O prawdziwości hipotezy zmienności Darwina

KWIECIEŃ 2025| LJK | ~ 835 słów |~ 5 518 znaków|

💬 Średni iloraz inteligencji kobiet i mężczyzn jest dokładnie taki sam, tylko, że u mężczyzn ten rozkład jest bardziej spłaszczony a u kobiet jest bardziej smukły. Z tego powodu mamy więcej geniuszy mężczyzn niż geniuszek kobiet, ale jest więcej osób o niższych zdolnościach poznawczych wśród mężczyzn niż wśród kobiet - tak brzmi hipoteza większej męskiej zmienności Darwina (ang. variability hypothesis). Czy jest prawdziwa, fałszywa - a może coś pomiędzy?

1️⃣ Wyobraź sobie wytłaczankę jaj. "Wytłaczanka" to papierowe pudełko ze specjalnymi wgłębieniami, w które wkłada się jajka do bezpiecznego transportu. W niektórych regionach Polski na te szare, chropowate formy mówi się ‘matlesy’. Z jaj wykluwa się dwanaście żółtych puchatych kurczaczków.

2️⃣ Więc, hodujesz kurczaki 🐤. Sześć z nich trzymasz w kurczak-friendly kurniku, a sześć z nich hodujesz w klatce. Sześć z nich chodzi swobodnie po trawce, sześć z nich - siedzi w klatce. Sześć z nich swobodnie chodzi po trawce, grzejąc się w słońcu, wygrzebując robaki i biegając za motylkami. Pozostałe sześć, cóż dalej siedzi w klatce, zazdrośnie obserwując na kolegów.

3️⃣ Po kilku tygodniach przyglądasz się tym dwóm grupom kurczaków i mówisz, zresztą nomen omen:”o kurczę, te z wolnego wybiegu są bardziej zróżnicowane niż tamte, które siedziały w klatce”.

4️⃣ Brzmi jak spot organizacji Otwarte Klatki? Być może, ale to przedstawienie tego, jak Karol Darwin wpadł na pomysł większej zmienności u mężczyzn niż u kobiet - tego, że mężczyźni są bardziej zróżnicowani niż kobiety. To stwierdzenie znane jest w nauce jako ciągle żywa - i ciągle nierozstrzygnięta - hipoteza zmienności. Hipoteza, która ma więcej warstw niż najogrszy z ogrów.

5️⃣ W języku statystyki zmienność wyników przedstawia się w postaci krzywej dzwonowej Gaussa, która pokazuje, które z wartości badanej cechy zdarzają się z jaką częstością. Tak się składa, że szczyt dzwonu jest umiejscowiony tuż nad średnią, co sugeruje, że najczęściej występującą wartością jest właśnie średnia arytmetyczna. Im dalej od średniej arytmetycznej, tym mniej spotykane wartości - to o nie w hipotezie zmienności chodzi najbardziej.

6️⃣ Dzwon u mężczyzn jest w tym samym miejscu, co dzwon kobiet, więc średni iloraz inteligencji kobiet jest taki sam, jak średni iloraz inteligencji mężczyzn. Innymi słowy, średnio rzecz biorąc mężczyźni są tak samo inteligentni jak kobiety. I w drugą stronę: średnio rzecz biorąc, kobiety są tak samo inteligentne jak mężczyźni. Jest jedna kolosalna różnica między nimi.

7️⃣ Dzwon u mężczyzn jest bardziej spłaszczony niż dzwon u kobiet. To powoduje, że obserwuje się więcej geniuszy mężczyzn niż geniuszek kobiet. Za to wśród osób o znacznie obniżonym ilorazie inteligencji jest również więcej mężczyzn niż kobiet. To jest prosta konsekwencja różnych stopni zmienności u obu płci - mimo wspólnej średniej.

8️⃣ I wszystko wydaje się być rozsądne i logiczne, i sprawa wygląda na oczywistą i zamkniętą, ale czy to prawda? Czy naprawdę kobiety są bardziej podobne do siebie, a mężczyźni bardziej zróżnicowani? Innymi słowy, czy hipoteza zmienności jest prawdziwa, czy Darwin nieświadomie popełnił błąd I-go rodzaju?

9️⃣ Spójrzmy na szerszy obraz sytuacji w XIX wieku. Popatrzmy na świat oczami Darwina i wówczas łatwiej będzie zrozumieć, dlaczego w ogóle pomysł przyszedł mu do głowy. XIX wiek uważa się za złoty wiek dla ludzkości - technika i technologia pchnęły rozwój cywilizacji do przodu. Rozwinęły się wszystkie nauki, w tym: medycyna.

🔟 Złoty wiek? Nie dla wszystkich, nie wszędzie, i zdecydowanie nie dla samych kobiet. Owszem, kobiety korzystały z osiągnięć epoki, ale w dużej mierze były raczej pasażerem siedzącym z tyłu powozu. Dlaczego? Uważano, że nauka zdrowiu kobiet szkodzi i trzeba je chronić przed nimi samymi. Kobiety nie mogły ot, tak po prostu pójść sobie na studia albo do pracy, wsiąść na statek i okrążyć świat. Poza nielicznymi wyjątkami, kobiety nie wymyślały różnych wynalazków. Były jak te kurczaczki trzymane w klatce. Kinder, Küche, Kirche - znacie to powiedzenie? Owszem, te zamożne były bardziej wykształcone niż te niezamożne, ale i jedne, i drugie były związane rolami kulturowymi, które nie pozwalały wykorzystywać potencjału intelektualnego. Jeśli już któreś z chłopskich dzieci można było posłać do szkoły, najczęściej był to chłopiec. No, wesoło nie było.

🏁 Wróćmy do XXI wieku. Czy to naprawdę prawda, że krzywa dzwonowa inteligencji u kobiet jest “węższa” niż krzywa dzwonowa mężczyzn? Czy naprawdę to normalne zjawisko, że mamy mniej geniuszek niż geniuszy i tak już będzie? Odpowiedź nie jest taka prosta. Nadal trwają badania nad rozstrzygnięciem hipotezy zmienności, a ruszyły już ponad sto lat temu.

W 1900 roku amerykańska psycholog Helen Bradford Thompson Woolley po raz pierwszy wykazała, że mężczyźni i kobiety nie różnią się pod względem zdolności poznawczych. Jedno badanie nie rozstrzyga - ktoś powiedziałby i miałby rację. Od tamtego czasu przeprowadzono wiele badań różnej krwi i maści. Z różnym skutkiem. Obecnie stan wiedzy nie pozwala na jednoznaczne stwierdzenie. Jedne badania ją wspierają, inne – nie. Nawet AI nie zna odpowiedzi na ten temat: “hipoteza męskiej zmienności jest tematem dyskusyjnym i wymaga dalszych badań, aby potwierdzić jej słuszność. Wyniki dotychczasowych badań są niejednolite, a interpretacja danych zależy od przyjętych założeń i metod statystycznych.

Hipoteza zmienności AKA więcej-geniuszy-niż-geniuszek jest naprawdę trudna do weryfikacji, ponieważ należałoby kontrolować to, co niekontrolowalne - wpływ kultury i wychowania. Wyjąć z głowy badanego to, co utknęło tam głębokom a to wydaje się prawie niemożliwe. Wygląda na to, że jeszcze długo nie poznamy prawdy o prawdziwości hipotezy zmienności.

Cześć!

LISTOPAD 2024| LJK | 225 słów |1,465 znaków

nazywam się Lili. Witaj na moim blogu Statystyka w Psychologii. Szybko zorientujesz się, że piszę o statystyce, przede wszystkim o metodach, które spotyka się w psychologii, ale nie tylko tam. Dokładniej o tym, dla kogo jest ten blog, przeczytasz w zakładce O blogu i o autorze. Wszystkie metody, jakie zdążyłam opisać, znajdziesz w zakładce Spis treści.

Blog ma ponad 10 lat. Minęło sporo czasu od jego założenia. Prawdę mówiąc, zaczęła go pisać inna osoba... - to znaczy jestem jedynym autorem tego bloga, od początku, więc niby ta sama osoba, ale mimo to trochę inna, dlatego oprócz wstawiania nowych treści, odświeżam też stare posty. Statystyka nie zmieniła się, ale sposób przedstawienia tematu - już tak i stąd konieczność wprowadzania zmian. Ostatnio odświeżone posty to ten o jednoczynnikowej analizie wariancji oraz o współczynnikach korelacji.

Oj, takie krótkie powitanie, a już zdążyłam napisać nieprawdę - przecież statystyka zmieniła się. Zmienia cały czas. Wiem to z doświadczenie, ponieważ jestem blisko od około 20 lat, od czasów studiów, i zaczęłam dostrzegać zmiany zachodzące w tej dziedzinie - w sposobie jej uprawiania przez badaczy. Przykład? Kiedyś nie było mowy o nadciągającym kryzysie w badaniach empirycznych. Było kilka podręczników, dość siermiężnych a SPSS był dużo bardziej podstawowy niż dzisiaj. Teraz jest inaczej, jest sporo osób, które pisze o statystyce - a jedną z nich jestem ja. Serdecznie zapraszam Cię do czytania! 🙂 Zacznij tu: KLIK

NHST 2.0: Procedura testowania istotności statystycznej hipotezy zerowej

MAJ 2026| LJK | ~1 655 słów | ~ 11 630 znaków


Wprowadzenie

Przez ostatnie dekady kroki statystycznej procedury weryfikacji hipotez naukowych przedstawiały się mniej więcej w taki sposób:

  1. Sformułowanie hipotez zerowej H0 i alternatywnej H1.
  2. Ustalenie poziomu istotności statystycznej – najczęściej przyjmuje się 5%, co oznacza 5% ryzyko odrzucenia prawdziwej hipotezy zerowej.
  3. Wybór testu statystycznego: Dobranie odpowiedniego testu (np. t-Studenta, do rodzaju danych i rozkładu.
  4. Obliczenie statystyki testowej: Obliczenie wartości na podstawie danych z próby.
  5. Podjęcie decyzji: Porównanie p-wartości, krótko: p, z poziomem istotności statystycznej. 
    1. Jeśli p < 0.05, to odrzucamy H0 na korzyść H1
    2. Jeśli p > 0.05, to przyjmujemy H0. Gdy p - wartość = 0.05, to badacz podejmuje decyzję.

Zanim przejdziemy do konkretnych kroków, zatrzymajmy się przy idei, która stoi za podejściem do testowania statystycznego. Pozwoli nam to zrozumieć, dlaczego w ogóle warto cokolwiek zmieniać – w końcu wiadomo, że lepsze bywa wrogiem dobrego - czyli skąd bierze się odejście od traktowania p-wartości jak mechanicznej „wajchy”, która zerojedynkowo mówi: „przyjmij” lub „odrzuć”. W nowym wydaniu testowania hipotez statystycznych, istotność statystyczna przestała być wyrocznią; stała się raczej wskazówką, która bywa podatna na zniekształcenia wynikające ze specyfiki danych. Nowoczesne podejście do testowania to już nie mechaniczna decyzja, a myślenie statystyczne.

Dla ułatwienia poniższy materiał dotyczący weryfikacji hipotez statystycznych dotyczy testu obustronnego.

Zacznijmy jeszcze raz, badacz nauk społecznych, np. psychologii, stawia hipotezę badawczą. Zgodnie z metodą naukową, należałoby zweryfikować zaproponowane stwierdzenie za pomocą badania empirycznego. Gdyby badacz był matematykiem, stanąłby przy tablicy i białą kredą zacząłby wyprowadzać wzór z przyjętych przesłanek. W dziedzinie nauk empirycznych tak to, niestety, nie działa. Już dawno temu umówiliśmy się, że ludzie są zbyt skomplikowani, aby na podstawie jednostkowego badania pojedynczej osoby dało się wyprowadzić prawa rządzące całą ludzkością. Badamy więc wiele osób (lub “osób”, ponieważ w psychologii porównawczej termin “osoba” obejmuje również pozostałych członków królestwa zwierząt) i analizujemy zbiorczo wyniki.

Jak wyniki badania mogłyby wykazać, że badacz ma rację? Jeśli jego hipoteza jest słuszna, dane w badaniu powinny zachowywać się tak, jak ona przewiduje. Jeśli hipoteza przewidywała, że jedna grupa osiągnie wyższe wyniki niż druga, to ten fakt powinien znaleźć odzwierciedlenie w średnich arytmetycznych. Jeśli hipoteza przewiduje pozytywny związek między zmiennymi, to wyższym wartościom jednej zmiennej powinny odpowiadać wyższe wartości drugiej zmiennej.

Problem w tym, że tak naprawdę nie interesuje nas tylko to, co dzieje się w tym jednym konkretnym badaniu - i tu pojawia się miejsce na testowanie statystyczne. Wszystko dlatego, że interesuje nas cała populacja i to, czy badana zależność w niej całej występuje. Tak naprawdę badacz liczy na to, że gdyby w toku badania otrzymał inną próbę, to wyniki byłyby zbliżone, prowadząc do tych samych wniosków. Na przykład, w każdej próbie kobiety miałyby średnio wyższe wyniki niż mężczyźni. Może nie zawsze o tyle samo wyższe, ale ogólnie - wyższe. Ubierając to w techniczne pojęcia, jeśli hipoteza badawcza jest słuszna, to wyniki uzyskiwane w próbie powinny być typowe, często spotykane, a jeśli częstość ma związek z prawdopodobieństwem, to również i wielce prawdopodobne. O tym, jak tę typowość sprawdzić, dowiemy się za chwilę.

Wyglądałoby na problem w odniesieniu rezultatów badania uzyskanych w próbie do wnioskowania na temat całej populacji jest tylko techniczny. Co w tym trudnego? Wystarczy przeprowadzić badanie, wykonać analizę statystyczną i sprawdzić, czy otrzymane wyniki są typowe, prawdopodobne w okolicznościach przewidywanych przez hipotezę badacza. Jeśli są bardzo prawdopodobne, to dobrze (dla hipotezy badawczej). Jeśli mało prawdopodobne, to - źle dla niej, choć źródeł tego, co mogłoby pójść nie tak, można dopatrywać się zarówno w braku słuszności postawionej hipotezy badawczej jak i w bardziej przyziemnych sprawach. Zatem, wydawało by się, że co w tym wszystkim skomplikowanego? Niestety, w toku weryfikacji hipotezy okaże się, że sprawa jest bardziej zawiła, a zawiłość pojawi się już w pierwszym momencie.


Hipoteza zerowa okularami badacza

Już na początku należy zauważyć, że dochodzi do przesunięcia punktu skupienia uwagi. W klasycznym testowaniu hipotez punktem wyjścia jest przyjęcie hipotezy zerowej o braku zależności. Czasami mówi się o niej, jako o zaprzeczeniu hipotezy badawczej. Osobną sprawą jest to, czy to jest dobre postępowanie. Studentom mówi się, że chodzi o tzw. konserwatyzm naukowy. Jest to stanowisko, w którym dostarczenie dowodu na istnienie jakiegoś zjawiska jest obowiązkiem osoby twierdzącej. Wychodzimy z punktu widzenia, że czegoś nie ma i pokazujemy, że jednak coś jest. Wydaje się to rozsądnym posunięciem. Oczywiście, mało kto jest na I lub nawet V roku studiów jest na tyle wyposażony w wiedzę z zakresu filozofii nauki, aby wejść w dyskusję. Dopiero po jakimś czasie przychodzi refleksja, że w końcu atakujemy nie tę hipotezę, którą chcieliśmy poddać weryfikacji. Długo po zakończeniu edukacji pojawia się myśl, aby zadać pytanie:”czy podważenie jakiejś hipotezy o braku zależności, która w gruncie rzeczy nie jest przedmiotem zainteresowania badacza, jest udowodnieniem jego hipotezy naukowej?”. Okazuje się, że to nie jest do końca dobrze pojęty konserwatyzm.

W tym świetle, przyjęcie perspektywy braku zależności jest po prostu wygodnym technicznie punktem wyjścia. Trzeba pamiętać, że testowanie hipotez statystycznych pojawiło się w czasach, gdy nie było maszyn obliczeniowych innych niż ludzki umysł. Zauważmy, że pytanie o typowość konkretnego wyniku jest zawsze pytaniem o rozkład wszystkich innych wyników. Zadaniem matematyków jest i zawsze było ten rozkład stworzyć, a jego stworzenie znacznie ułatwia się po przyjęciu braku zależności (efektu). W najlepszym razie używa się argumentu, który zawsze ucina dyskusję: “bo tak zawsze było” i wraca do punktu wyjścia - stawiamy hipotezę zerową.

Wracając do głównego wątku, badacz stawia hipotezę zerową o braku zależności, która jest tłumaczeniem na język pojęć statystycznych nawet nie samej hipotezy badawczej a jej negacji. Niepostrzeżenie to hipoteza zerowa staje się okularami, przez które patrzy na otrzymane w analizach wyniki. W klasycznym testowaniu hipotez żyjemy i dokonujemy obliczeń w świecie, w którym badana zależność nie istnieje. W takim razie, co dane mogą powiedzieć badaczowi? Czy to, że są przypadkowym dziełem losowych fluktuacji? Czy to, że hipoteza zerowa jest prawdziwa?

Niestety, żadna z tych odpowiedzi nie jest prawidłowa.


Test statystyczny, w którym hipoteza zerowa rządzi

Zanim jeszcze na dobre rozgości się zagadnienie testowania hipotez, warto wiedzieć, że najpierw dochodzi do przekształcenia surowych wyników i całej zawartej w nich informacji do pojedynczej liczby zwanej wartością statystyki testowej. To ona stanowi trzon testu statystycznego. 
surowe dane w bazie → wartość statystyki testowej

Wartość statystyki testowej, czyli liczbowy wynik testu statystycznego, np. t = 1.72, dostarcza odpowiedzi na techniczne pytanie w postaci wskaźnika zwanego p-wartością. P-wartość mówi jak jest prawdopodobieństwo wystąpienia takiej wartości statystyki testowej, jak uzyskana przez nas oraz większej, o ile te okulary są dobre, czyli o ile nie ma zależności między zmiennymi.

  • Mała p-wartość, np. p = 0.023, oznacza mało prawdopodobny wynik, nietypowy dla hipotezy zerowej.
  • Duża p-wartość np. p = 0.823, oznacza wielce prawdopodobny wynik, typowy dla hipotezy zerowej.

WARTOŚĆ EPISTEMICZNA | To jeszcze nie wszystko. Pozostało pytanie o to, jaka jest wartość epistemiczna tej małej czy dużej p-wartości? Czego dowiadujemy się dzięki temu, że wynik jest mało czy bardzo prawdopodobny? Aby to dobrze zrozumieć, musimy pamiętać o okularach trzymanych na nosie, przez które badacz patrzy na otrzymane rezultaty.

Hipoteza zerowa H0 jest modelem rzeczywistości, w którym zależność między zmiennymi po prostu nie istnieje (np. obie grupy nie różnią się pod względem badanej cechy, nie ma korelacji). Współcześnie uważa się, że z pomocą p - wartości badacz dowiaduje się, w jakim stopniu jego dane są zgodne z tym modelem. Czy układają się w taki sposób, który jest zgodny ze wzorcem braku zależności, czy też nie.

Zauważ, że w tym nowym podejściu nie ma żadnej mowy o podejmowaniu decyzji o przyjmowaniu/odrzucaniu jakiejkolwiek hipotezy - w zamian jest sprawdzenie, jak wyglądają dane na tle jednej z nich. Obecnie p-wartość stała się tylko jednym ze wskaźników branych pod uwagę w weryfikacji hipotez, a nie rozstrzygającą wyrocznią.

W takim razie kiedy można uznać, że dane są zgodne z hipotezą zerową? Cóż, przyjęło się uznawać 5% za punkt odcięcia. Nie jest to efekt jakiegoś dowodu matematycznego, ale pewna umowa, która ułatwia interpretację.

  • P-wartość poniżej 5% mówi, że dane nie są zgodne z hipotezą zerową. O takim wyniku testu mówi się, że jest istotny statystycznie.
  • P-wartość powyżej 5% mówi, że dane są zgodne z hipotezą zerową. O takim wyniku testu mówi się, że jest nieistotny statystycznie.

Pierwszy krok testowania: badanie istotności statystycznej

1️⃣ W ten sposób dotarliśmy do pierwszego kroku testowania. Jest nim badanie istotności statystycznej, czyli sprawdzenie na ile dane są prawdopodobne pod hipotezą zerową H0

Nieistotny statystycznie wynik mówi, że dane zachowują się tak, jak powinny w sytuacji braku zależności. Z kolei o istotnym statystycznie wyniku można powiedzieć w następujący sposób: zachowanie danych jest dziwne, jeśli hipoteza zerowa miałaby być słuszna, prawdziwa. Pojawia się tu pewien problem. O ile istotność statystyczna poddaje w wątpliwość hipotezę zerową, mało prawdopodobny nie oznacza jeszcze nieprawdopodobny. Trzeba zebrać więcej informacji.

Dla badacza empirycznego nie jest to dobra wiadomość. Badacz chciałby mieć napisane czarno na białym, że hipoteza zerowa o braku zależności jest fałszywa, nieprawdziwa, niesłuszna, odrzucona, że może podjąć decyzję o jej odrzuceniu. Niestety, niezgodność danych z hipotezą zerową (czyli istotny statystycznie wynik) jeszcze nie oznacza obalenia hipotezy zerowej. Nie oznacza też potwierdzenia hipotezy badawczej. Niska p-wartość jest dopiero sygnałem, że brak zależności nie jest dobrym opisem danych. Innymi słowy, że hipoteza zerowa może być złymi okularami.

W tym miejscu powinno paść pytanie: “gdzie w tym wszystkim hipoteza badawcza?” Przecież p-wartość nie odnosi się do hipotezy naukowej autora badania. Dane mogą być sprzeczne z hipotezą zerową, ale wcale nie musi to uwiarygodnić jego przewidywań. Dzieje się tak zwłaszcza wtedy, gdy zakłada on konkretny kierunek zależności, a nie jedynie samo istnienie jakiegoś związku.


Drugi krok testowania: kierunek zależności

2️⃣ Oprócz badania istotności statystycznej w teście, drugim krokiem w porządnej weryfikacji hipotez jest zatem upewnienie się o tym, że dane zachowują przewidywany kierunek zależności między badanymi zmiennymi.

Czym jest kierunek zależności? To po prostu charakter relacji między zmiennymi – na przykład założenie, że wraz ze wzrostem jednej zmiennej rośnie także druga, albo że jedna z grup uzyskuje średnio wyższe wyniki niż pozostałe. Czasami w danych udaje się wykryć związek, ale okazuje się on odwrotny do oczekiwań: różnica między grupami ma inny zwrot, a korelacja przeciwny znak. Dlaczego tak się dzieje? Dwa najczęstsze powody to niezrozumienie mechanizmów leżących u podstaw zjawiska (np. gdyby badacz założył, że kobiety są średnio wyższe od mężczyzn, mimo literatury mówiącej coś przeciwnego) lub trafienie na bardzo specyficzną próbę.

Jeśli badacz nie upewni się, czy zaobserwowana zależność ma pożądany kierunek, może przedwcześnie ogłosić sukces. Tymczasem dane mogą wręcz wywracać jego teorię do góry nogami. Wynik może być istotny statystycznie, ale hipoteza badawcza pozostanie niepoparta. Dlatego tak kluczowe jest uważne przyglądanie się kierunkowi zależności, a nie tylko samym gwiazdkom przy p-wartości.

Badanie kierunku zależności to najprostsza część procedury wnioskowania. Jak to zrobić? Wszystko zależy od tego, czego szuka się. Czy szukasz korelacji czy różnic między grupami. Wystarczy sprawdzić znak współczynnika korelacji, na wielkość średnich, itd. i upewnić się, że ma znak zgodny z tym, co przewiduje badacz.


Trzeci krok testowania: ocena wielkości efektu

3️⃣ Istotność statystyczna i prawidłowy kierunek zależności jeszcze nie decydują o potwierdzeniu hipotezy badawczej. Od czasu kryzysu replikacyjnego środowisko naukowe przekonało się, że istotność statystyczna nie jest tożsama z istotnością praktyczną. Przykładowo, korelacja może być istotna statystycznie, ale nieistotna w praktyce. Dlatego ostatnią rzeczą w procedurze jest sprawdzenie wielkości efektu (ang. effect size). Wielkość efektu to siła zjawiska - miara tego, jak bardzo związane są ze sobą zmienne. Innymi słowy, to odpowiedź na pytanie:”choć dane pokazują istnienie zależności, ale jaka jest jej skala?”

Do każdego głównego scenariusza badawczego można przyporządkować co najmniej jedną taką miarę. Przy analizie współzmienności wykorzystamy współczynnik korelacji r Pearsona, natomiast w badaniu różnic między grupami – d Cohena lub η2 (eta-kwadrat). W tym kroku sprawdzamy, czy siła zależności ma znaczenie praktyczne i czy nie jest po prostu zaniedbywalna. Istnieją konkretne progi interpretacyjne, które pomagają to ocenić. Na przypadku współczynnika korelacji r-Pearsona standardowo przyjmuje się wartości między – 0.1 a + 0.1 jako przedział zaniedbywalnych korelacji. Oczywiście należy pamiętać, że to tylko pewne umowne ramy, jednak dają one pogląd na to, co jest realnym efektem, a co jedynie statystycznym szumem – nawet jeśli ten szum wydaje się układać w przewidywaną przez badacza stronę.


Interpretacja wyników testu

Podsumowując, współczesna interpretacja wyników testu statystycznego to zestaw trzech pytań:

  1. czy wynik testu jest istotny czy nieistotny statystycznie? Tj. czy otrzymany przez nas wynik jest typowy dla hipotezy zerowej, czy też nie. 
    • Co oznacza istotność statystyczna testu? 
    • technicznie | prawdopodobieństwo uzyskania danych 
    • epistemicznie | czy dane są zgodne z hipotezą zerową czy też nie? Czy model opisu danych, który proponuje hipoteza zerowa, jest dobrym opisem rzeczywistości? 
  2. czy kierunek zależności jest zgodny z przewidywaniem postawionym przez badacza w hipotezie badawczej (różnica między hipotezami). 
    • Ten krok zapobiega myleniu istotności statystycznej z potwierdzeniem hipotezy badawczej. Może zdarzyć się tak, że badacz przewiduje korelację dodatnią, a tymczasem korelacja jest ujemna albo różnica między średnimi jest w odwrotnej kolejności. 
  3. czy wielkość efektu nie jest zaniedbywalna? jest więcej niż zaniedbywalna - system progów Cohena dla praktycznie każdego schematu badawczego. 
    • Ten krok wykonuje się, aby uniknąć problemu z istotnym statystycznie, lecz nieistotnym praktycznie wynikiem (to trudne w interpretacji)

Dopiero na tej podstawie 3 x tak możemy stwierdzić, że hipoteza badawcza została w konkretnym badaniu “potwierdzona” (aka. dane dostarczają wsparcia empirycznego).

Statystyka klasyczna i bayesowska #storytime

STYCZEŃ 2023| LJK | ~500 słów

PRZED UŻYCIEM TEKSTU PRZECZYTAJ ULOTKĘ LUB ... SKONSULTUJ SIĘ Z AUTOREM — Tekst, który zaraz przeczytasz, jest literacką wersją porównania dwóch szkół statystyki: klasycznej i bayesowskiej. Literacką, więc jego celem jest wzbudzenie ciekawości odbiorcy i oddanie odczuć kogoś, kto przenosi się z jednego sposobu uprawiania statystyki na drugi. Nie jest to typowo podręcznikowe porównanie w tabelce z dwoma kolumnami, więc po ostatniej kropce nie popędzisz od razu robić analizy. Takie posty pojawią się na blogu jakiś czas. Na razie zobacz, jak to jest zmieniać szkołę.


NAPIS NAD WARSZTATEM JEST DUŻY I WYRAŹNY. Zapisano go bezszeryfową czcionką – taką, jaką zwykle używa się, gdy nazwa ma poważnie brzmieć. Ale teraz go nie widać - jest zbyt ciemno i litery giną w mroku. Z ciemności wyłania się Researcher, wchodzi szybkim krokiem do pomieszczenia i od razu zakrywa oczy ręką. Jaskrawo świecące żarówki oślepiają, a to boli. Może dlatego noworodki krzyczą tuż po narodzinach. Zanim oczy przyzwyczają się do światła, mija kilka sekund. Wreszcie powoli wyłaniają się jakieś kształty. Researcher rozgląda się. Warsztat jak warsztat. Jest stół, są narzędzia. Półki wypełnione papierzyskami. Szafy, szuflady i szafki. Wszystko wygląda tak samo, a jakby inaczej.

Gdyby to był jego warsztat, dane – całe naręcza danych – leżałyby przy blacie najbardziej oświetlonego stołu. Na blacie stałaby maszyna, która u góry ma okrągły, plastikowy wsyp, a z tyłu wylot wytworzonego z danych produktu. Z boku ma też wąską szczelinę, w którą wkłada się specjalną matrycę - wzornik pokazujący, jak dane powinny układać się zgodnie z taką czy inną hipotezą. W warsztatach jego typu najczęściej używa się matrycy hipotezy zerowej, która pokazuje układ danych, gdy tylko działa tylko przypadek. Gdy z maszyny wyleci produkt, bierze się takie narzędzie podobne do licznika Geigera i ogląda jak częsty jest to okaz. Ale jego warsztatem napisano ”statystyka klasyczna”. Ten tutaj to warsztat statystyki bayesowskiej.

Wszystko jest tutaj inne. Dane znajdują się w takim samym kontenerze, ale główny blat stołu zajmuje inna maszyna z innymi pokrętłami i jedną dużą korbą. Ilustrowana instrukcja, taka jak z IKEA, pokazuje mechanizm działania maszyny. Z lewej strony znajduje się płytka. Teraz jest pusta. Korbą kręci się, tak aby to, co będzie na płytce wsunęło się do środka maszyny. Następnie zwalnia się przycisk wstrzymujący dane wsypane od góry i z prawej strony wysuwa się płytka, na której leży jakiś poładowany kształt, jakby ulepiony z gliny. Rozkład a priori – odczytuje Researcher.

To, co ma znaleźć się na lewej płytce w ogromnych ilościach leży w szklanych szafach przy biurku. Opis na drzwiach łatwo odczytać – rozkład a priori, uprzednia wiedza badacza. W przezroczystych pojemnikach znajduje się plastyczny materiał, z którym maszyna syntetyzuje dane – rozumuje Researcher i sięga po jeden z pojemników. Wszystkie opatrzono etykietami: informative prior, Gaussian prior. Researcher niby zna niektóre pojęcia, ale do tej pory inaczej z nimi postępował. Na przykład taki Gaussian oznacza rozkład gaussowski, normalny. Cecha miała rozkład normalny, gdy w populacji jej wyniki układały się w pewien szczególny sposób: tych blisko średniej było najwięcej, a im dalej od średniej, tym rzadziej. Nie trzeba go było modyfikować. Dziwne – myśli Researcher. Na jednej półce stoi samotnie pojedyncze pudełko – uniform prior, rozkład jednostajny, wszystkie wartości mają jednakową szansę przytrafienia się. Ach, to w czymś takim Laplace zaklął niewiedzę czy też ignorancję badacza. Researcher chwilę obraca je w palcach i delikatnie odstawia na miejsce.

Zaraz, zaraz – gwałtownie odwraca głowę w kierunku głównego stołu. - A gdzie w tym warsztacie jest signifikantometr, istotnościomierz? Który przyrząd służy do pomiaru istotności statystycznej wyniku? Przegląda jeszcze raz wszystkie narzędzia, przeszukuje szuflady, nie zwracając na to, że grzebie w cudzym. To niemożliwe – stwierdza ze zdziwieniem. – W warsztacie statystyki bayesowskiej nie ma istotności statystycznej.

Diagnostyka normalności: Liczby i rysunki

Rozkład normalny to podstawowy rozkład w statystyce. Mówimy, że taka-to-a-taka cecha ma rozkład normalny. Że założenia testów różnych testów statystycznych: testu t-Studenta oraz analizy wariancji ANOVA wymagają rozkładu normalnego. Że model jest dobry, gdy rozkład błędów jest normalny. Skąd jednak badacz ma wiedzieć, czy zebrane przez niego liczbowe wartości zmiennej układają się zgodnie z krzywą Gaussa? W tym poście piszę, jak należy sprawdzać, czy cecha w zebranej przez Ciebie próbie może mieć rozkład zbliżony do normalnego. Jeśli chcesz przejść od razu do narzędzi, kliknij tutaj: KLIK.

SPIS TREŚCI:

WPROWADZENIE — W każdej dziedzinie jest zbiór pojęć rozpoznawanych poza nią. W psychologii jest to np. procesy poznawcze. W statystyce takim pojęciem funkcjonującym w zbiorowej świadomości jest rozkład normalny łatwo zapamiętywalny ze względu na charakterystyczny, dzwonowaty kształt. Wiele lat temu uważano, że rozkład normalny stanowił dobry model zjawisk społecznych. Obecnie odchodzi się od tego myślenia, ale nie zmienia to jego popularności, zwłaszcza że analizy, jakie wykorzystują badacze, opierają się na tym rozkładzie. Więcej informacji na temat rozkładu normalnego znajdziesz w poście  KLIK. Tutaj ograniczymy się do tylko części potrzebnej do zrozumienia, jak działają narzędzia diagnostyczne służące do - jak sama wskazuje - diagnozy tego, czy badana cecha ma rozkład normalny. Takie zadanie często stoi przed badaczem i najprawdopodobniej szukałby on jakiegoś testu statystycznego. Wiadmo, jak statystyka, to testy. Badacze mają nawyk testowania wszystkiego w dobrym i złym tego słowa znaczeniu, więc nic dziwnego, że jako pierwsze przychodzą do głowy testy statystyczne. Istnieją jednak inne nie-testowe metody oceny normalności rozkładu — i o tym jest ten post.

DIAGNOSTYKA NORMALNOŚCI A TYP POMIARU — Narzędzia służące do oceny normalności rozkładu stosujemy tylko i wyłącznie wtedy, gdy wiemy, że mierzona przez nas zmienna czy badana cecha ma najwyższy w skali Stevensa, ilościowy typ pomiaru, np. jest to czas reakcji, wiek, długość, szerokość. Często przyjmuje się, że wyniki ogólne w kwestionariuszach również charakteryzują się tym typem pomiaru. Chodzi o to, że narzędzia, jakie zaraz poznasz, działają dla tych zmiennych, których wartości reprezentują matematycznie rozumiane liczby. Liczby, które można dodawać, mnożyć, dzielić, a nie "liczby" ujęte w cudzysłów, bardziej znaki graficzne, jak dla zmiennej nominalnej albo porządek jak dla zmiennej porządkowej. Rozkład normalny mogą posiadać jedynie zmienne ilościowe. Nie badamy normalności dla płci (kobieta, mężczyzna, niebinarna) czy wykształcenia (mierzonego kategoriami: podstawowe, średnie, wyższe)

CZY ISTNIEJE JEDEN ROZKŁAD NORMALNY? Patrząc na powyższy rysunek, widzimy tylko jeden z możliwych rozkładów normalnych. Taki, który ma parametry 0 i 1. Kreskowaną linią zaznaczono szczyt tej krzywej, który jednocześnie jest średnią. Ponieważ zamiast zera i jedynki może stać tutaj absolutnie dowolna liczba rzeczywista, to rozkładów, o których można powiedzieć, że są normalne, jest nieskończenie wiele. Dlaczego jest ich nieskończenie wiele, a jakby jeden? Wszystkie łączy ten sam wzór ogólny. Posiadając wspólną matematyczną formułę, tworzą jedną rodzinę. Jedyne, co się w niej zmienia, to drobiazgi zwane parametrami - to co na rysunku jest zerem i jedynką. Ogólny wzór pozwala narysować krzywą Gaussa przypominającą dzwon (choć czasem trudno go zobaczyć).

Na podobnej zasadzie działa funkcja liniowa np. y = x + 2 lub y = -x - 1.



W każdym wzorze zamiast jedynek i dwójek mogłaby stać dowolna inna liczba, a i tak nadal byłaby to funkcja liniowa z wykresem w postaci linii prostej. Wszystkie spełniają tzw. ogólny wzór postaci: y = a*x+b. Podobnie, rozkłady normalne mają jeden wspólny wzór, choć nieco bardziej skomplikowany niż ten na funkcję liniową. Widzisz go w górnym lewym rogu poniższej ilustracji:


Rozkład, którego rysunek widzisz, jest jednym z wielu rozkładów normalnych, ale jest to charakterystyczny członek tej rodziny - tzw. rozkład standardowy normalny N(0,1), gdzie zero to pierwszy parametr zwany średnią, a jeden to drugi parametr zwany odchyleniem standardowym.

Wspólny wzór powoduje, że mimo różnic w wyglądzie, członkowie rodziny rozkładów normalnych dzielą podobne własności i to właśnie wykorzystują narzędzia diagnostyczne. Rozsądne byłoby pomyśleć tak: jeśli oczekujemy, aby badana cecha (lub szerzej - zmienna) miała rozkład normalny, to powinna się w rozsądnym stopniu wykazywać tymi właściwościami.

Na przykład, jeśli chcesz sprawdzić, czy masz do czynienia z psem, to sprawdzasz, czy dany obiekt szczeka, ma ogon i chodzi na czterech łapach (lub w odwrotnej kolejności). Wszystkie nieuszkodzone psy mają te właściwości.

NARZĘDZIA DIAGNOSTYCZNE — Narzędzia diagnostyczne dzielą się na liczbowe i na graficzne. Te pierwsze po prostu liczby, a profesjonalnie rzecz mówiąc: statystyki opisowe. Te drugie to wykresy. O ile wskazanie teoretycznych wartości statystyk liczbowych nie jest trudne, problemem staje się to, jak pokazać działanie empirycznych narzędzi na teoretycznym tworze, jakim jest rozkład normalny. Poradzimy sobie, stosując mały trik. Skoro przyjmuje się, że rozkład teoretyczny jakieś cechy to rozkład w całej populacji, to weźmiemy przeogromną próbę i na takiej zbadamy zachowanie narzędzi. W ten sposób będziemy mogli zbliżyć się do teoretycznego rozkładu normalnego i jednocześnie poznać narzędzia diagnostyczne.
Oto lista narzędzi wraz z omówieniem ich zachowania wśród rozkładów teoretycznych (niżej jest lista z omówieniem zachowania w próbie)

  • STATYSTYKI OPISOWE
    • skośność - miara asymetrii rozkładu. Rozkład normalny ma zerową skośność. Więcej na ten temat znajdziesz w poście: KLIK
    • kurtoza - miara koncentracji i obecności obserwacji odstających. Rozkład normalny ma zerową kurtozę. Więcej na ten temat znajdziesz w poście: KLIK
  • WYKRESY
    • histogram — wykres pokazujący ogólny kształt rozkładu poprzez zestaw prostokątów, których szerokość to przedział liczbowy, a wysokość to liczba obserwacji, które znalazły się w tym przedziale. Więcej o histogramie: KLIK. Mimo tego, że rozkładu teoretycznego nie przedstawia się za pomocą histogramu, a za pomocą gładkiej linii reprezentującą gęstość lub kropek reprezentujących funkcję prawdopodobieństwa (mówimy o teoretycznych sprawach), to przeogromna próba będzie substytutem populacji. Powinna się wpasowywać w krzywą Gaussa.
    • wykres skrzynkowy (boksplot) - wykres, pokazujący jeden prostokąt z wąsami. Rozkład normalny tworzy wykres postaci:
      Jest on symetryczny względem czarnej poziomej linii reprezentującej medianę. Wąsy są w równej odległości od dolnej i górnej krawędzi skrzynki. Rozkład normalny posiada też obserwacje odstające (outliery) - a to ze względu na regułę 3 sigma. Więcej o boxplocie: KLIK
    • wykres kwantylowy wykres przestawiający punkty.
      Na osiach znajdują się kwantyle rozkładu badanej cechy oraz kwantyle rozkładu normalnego. Więcej o wykresie kwantylowym: KLIK

ZACHOWANIE NARZĘDZI W PRÓBIE — Przeanalizujemy teraz każde z narzędzi i omówimy jego zachowanie w próbie. Przechodząc z teorii do empirii, należy pamiętać, że są dwie rzeczy, które mają wpływ na to, że najczęściej jedno z drugim nie zgadza się i powoduje, że nie możemy oczekiwać tych samych wyników w próbie.

LOSOWA ZMIENNOŚĆ — Wiemy, że rozkład normalny ma zerową skośność i zerową kurtozę, a wykresy mają określony wygląd. Czy w związku z tym możemy oczekiwać, że w próbie będzie dokładnie tak samo? Nie. Te wymagania są zbyt idealne, aby pojawiły się w naszym świecie empirycznym. Rozkład normalny jest przecież rozkładem teoretycznym – zerowa skośność i zerowa kurtoza nie wynika z czyjegoś doświadczenia, a z precyzyjnych matematycznych obliczeń. Trzeba jednak pamiętać, że jest to wynik teoretyczny. Oczekiwania, co do tego, co pojawi się w zebranej przez badacza próbie, muszą być łagodniejsze.

Najłatwiej wytłumaczyć to sobie w następujący sposób: gdybyśmy zgromadzili wszystkie osoby (tj. przebadali całą populację) i wówczas policzyli skośność i kurtozę, to powinna ona wynosić zero - zero jest populacji. Ale próba jest tylko wycinkiem populacji i mogą trafić się różne osoby (czyli wchodzi tu losowość wyników), więc trudno liczyć na to, że skośność i kurtoza będzie równa dokładnie zero. Dlatego musimy wykazać się pewną elastycznością w oczekiwaniu, że wartości statystyk opisowych w próbie będą zero. Innymi słowy, musimy zaakceptować pewne niezerowe (choć bliskie zeru) wartości a nie żądać dokładnych zer.

ZNACZENIE WIELKOŚCI PRÓBY — Trudno jednak nie wspomnieć o wadzie tych reguł kciuka - są one sztywne, czyli niezależne od liczby przebadanych osób. A przecież nawet na chłopski rozum, nawet gdy badana zmienna ma rozkład normalny (np. inteligencja), to wzrost liczby badanych powinien powodować zbliżanie się skośności i kurtozy do tej idealnej, zerowej wartości. Podobnie jest z wykresami. To, co uchodzi w małej próbie, nie powinno przytrafi się w dużej.

REGUŁY KCIUKA Z pomocą przychodzą wskazówki, które mówią, jaki przedział niezerowych wartości skośności i kurtozy można dopuścić jako przedział takich wartości, które jeszcze nie powodują uznania, że badany rozkład nie jest rozkładem normalnym. Nazywam je regułami kciuka - powinny sprawdzać się w większości typowych sytuacji, ale nie mają statusu twierdzenia matematycznego. Dla ścisłości, będziemy mówić o próbkowej skośności (teoretyczna wynosi 0) i próbkowej kurtozie (teoretyczna wynosi 0) oraz o empirycznych wykresach. Wszystko dlatego, aby podkreślić, że liczymy statystyki i tworzymy wykresu z udziałem próby, a nie teoretycznych wartości.

NARZĘDZIA DIAGNOSTYCZNE

  • STATYSTYKI OPISOWE
    • skośność — Przedział niezerowych, lecz wciąż akceptowalnych wartości próbkowej skośności to [–1, 1].


    • kurtoza — Przedział niezerowych, lecz wciąż akceptowalnych wartości próbkowej kurtozy jest nieco szerszy niż dla skośności i wynosi [–2,2].


    Jeśli zobaczysz skośność badanej zmiennej w przedziale między minus 1 a 1, to nie odrzucaj od razu normalności rozkładu. Podobnie, jeśli zobaczysz kurtozę badanej zmiennej w przedziale od minus 2 do 2.  To, że skośność wynosi np. 0,56 a nie 0 jeszcze nie oznacza, że rozkład nie może być normalny. Pamiętaj jednak, że ta sama wartość skośności i kurtozy różnie wygląda na tle małej lub dużej próby. Przykładowo, podczas gdy skośność równa 2,01 w próbie liczącej n = 30 osób jest akceptowalna, to w dużej próbie liczącej n = 30 000 osób jest podejrzanie dużym wynikiem.

  • WYKRESY
    • wykres skrzynkowy (boksplot) — wykres skrzynkowy dla małej próby, N = 10, dla umiarkowanej próby, N = 30, oraz dla dużej próby, N = 1000. Wykres dla dziesięciu osób zupełnie nie przypomina wykresu skrzynkowej rozkładu normalnego, a przecież wiemy, że te dziesięć wartości pochodzi z rozkładu normalnego. Przyczyną jest losowa zmienność, która zaciera charakterystyczną strukturę tego wykresu. Dla trzydziestu wartości boksplot jest przynajmniej symetryczny, a najpiękniejszy z nich jest wówczas, gdy zbierzemy wartości od tysiąca osób.
    • histogram — tutaj również pokazane są histogramy dla trzech typów prób: o bardzo małych liczebnościach, N = 10, dla umiarkowanych prób, N = 30 oraz dla prób o dużej liczebności N = 1000. Histogram rozkładu cechy, nawet jeśli wiadomo, że w populacji jest ona gaussowska, w małej próbie jest w ogólnie podobny do dzwonowej krzywej Gaussa. Cechy charakterystyczne histogramu są widoczne dopiero w dużych próbach.
    • wykres kwantylowy — aby badana zmienna posiadała rozkład normalny, punkty powinny układać się na prostej. Tak dzieje się na trzecim wykresie, ale jednocześnie jest to wykres próby bardzo licznej o N = 1000 obserwacji. W mniejszym próbach musimy zrezygnować z takiego oczekiwania.

KONIECZNOŚĆ STOSOWANIA TESTÓW NORMALNOŚCI? — Narzędzia palpacyjne, takie jak powyżej, to inna oprócz formalnych testów statystycznych metoda badania normalności rozkładu zmiennej. Niestety, badacze są przyzwyczajeni do tego, że testy statystyczne to jedyna poprawna opcja. Tymczasem to po pierwsze nieprawda, jak widać na załączonym obrazku, a po drugie - testy statsytyczne same w sobie obarczone są problemami. Zwróćmy uwagę, że nigdzie nie kontrolujemy liczebności próby, posługując się mglistymi stwierdzeniami, że takie-to-a-taki test jest mocniejszy niż inny. Kierowanie się tylko i wyłącznie istotnością statystyczną testu normalności może sprawić, że badacz popełni błąd. Najlepsze rozwiązanie to łączyć obie metody - palpacyjną i formalną.

DIY - czyli zrób Diagnostykę normalności w SPSS 28. Masz niższą wersję? Nie martw się. Różnice w krokach między tą wersją SPSS a pozostałymi są chyba - nomen omen - nieistotne.

1. Zidentyfikuj zmienną, której normalność chcesz badać. Tutaj ta zmienna nazywa się banalnie - po prostu: Cecha. Następnie wybierz Analiza -> Opis statystyczny -> Eksploracja.

2. Przesuń badaną zmienną z lewego, białego okna na prawe, górne o nazwie Zmienne zależne. Dzięki temu SPSS będzie wiedzieć, którą zmienną diagnozujesz.

Klikając przycisk Statystyki, nic szczególnego nie ma do wyboru. SPSS wie, co ma wybrać. Więc pozostaw zaznaczoną opcję Statystyki opisowe i wciśnij Dalej.

4. Kliknij na drugi od góry przycisk Wykresy. Pojawi się nowe okienko. W panelu Wykresy skrzynkowe pozostaw domyślnie zaznaczoną opcję Poziomy czynnika razem. W panelu Opis odznacz Łodyga-i-liście (tym wykresem nie będziemy zajmować się) i zaznacz Histogram. Następnie, zaznacz okienko Wykresy normalności z testami. Mimo tego, że w tym poście nie zajmujemy się testami normalności, to aby uzyskać wykres kwantylowy (qqplot), musimy zaznaczyć wszystko.

Naciśnij Dalej.

5. Gdy wrócisz do głównego okienka, wybierz OK. To już wszystkie polecenia, jakie są nam potrzebne.

P-wartość test

Testuję quiz odnośnie p-wartość. Jeśli ktoś ma ochotę wypróbować, to zapraszam:

Hipoteza zerowa i p-wartość: link pomiędzy nimi.

Jak mają się wyniki istotne statystycznie do hipotezy zerowej? Związek między p-wartością a H0 przedstawiam niżej w trzech aktach.

SPIS TREŚCI:

HIPOTEZA ZEROWA Ogólnie można przyjąć, że hipoteza zerowa mówi o braku związku między zmiennymi (na przykład: brak korelacji, brak różnic między grupami, niezależność dwóch zmiennych).

W większości przypadków taka perspektywa sprawdza się - do czasu jak spotykamy testy normalności.

Weźmy konkretny przykład – różnice międzypłciowe w średnim poziomie zarobków. Chodzi o tzw. gender pay gap. To zjawisko z zakresu ekonomii, które polega na tym, że średni poziom zarobków mężczyzn jest wyższy niż średni poziom zarobków kobiet. Mężczyźni zarabiają więcej niż kobiety na całym świecie. Nie jest to coś, co cieszy, ale badania pokazują, że istnieje w wielu krajach. Dla przykładu, powiedzmy, że chcielibyśmy sprawdzić, jak to jest w Polsce. Mamy zatem dwie kategorie (kobieta/mężczyzna) i zmienną ilościową (wynagrodzenie w złotówkach) – zatem test t-Studenta. Ponadto obserwacje są niezależne, bo trudno losowo przydzielić osoby badane do jednej z dwóch kategorii.

Hipoteza zerowa w teście t-Studenta brzmi H0: μ1 = μ2 Jest to ogólny zapis, pasujący do każdego badania spełniającego wyżej nakreślone warunki. Ponieważ nasz przykład odnosi się do luki płacowej to hipoteza zerowa tutaj brzmi: nie ma różnic między kobietami a mężczyznami w średnim wynagrodzeniu. Można ją zapisać symbolicznie H0: μkobiety = μmężczyźni

Gdyby nie było zmienności, sprawa byłaby prosta - różnica między średnimi zawsze wynosiłaby zero - w każdej z prób - niezależnie, kto badałby ją i w jakim miejscu na Ziemi: czy w Polsce, w Szwecji czy w USA. Zatem bardzo ubogi histogram, a raczej hybryda histogramu i wykresu słupkowego i wyglądałaby tak:

W zdaniach powyżej używam trybu przypuszczającego, ponieważ tak wyglądałby świat bez zmienności. Ta zmienność jest charakterystyczną cechą otaczającego świata. Przecież mężczyźni zarabiają różnie – podobnie jak kobiety. Płace różnią się nawet bez podziału na płeć.  To powoduje, że nawet badając to samo zjawisku, otrzymuje się różne wyniki. Różnica między średnimi zarobkami kobiet i mężczyzn w prawie każdej próbie nie będzie równa zero.

I tu jest właśnie rola statystyki – czy z faktu, że na próbie wyszło, że są różnice, to mogę powiedzieć, że w całej populacji również są różnice? Czy jeśli średnia zarobków kobiet w moim badaniu jest niższa niż średnia zarobków mężczyzn, to jednocześnie w populacji średnia kobiet jest niższa niż średnia zarobków mężczyzn?

HIPOTEZA ZEROWA ... I ROZKŁAD STATYSTYKI TESTOWEJ Hipoteza zerowa robi coś więcej niż tylko siedzi i opowiada o braku związku. Jest to przecież hipoteza statystyczna, a każda hipoteza statystyczna tak naprawdę postuluje pewien rozkład wyników. Jakich wyników? Nie surowych, zebranych przez badacza, znajdujących się w wierszach i kolumnach SPSS-a, ale wyników statystyki testowej. Statystyka testowa to sedno każdego testu statystycznego. Jest to wzór, który przekształca surowe dane – mówiąc metaforycznie, wysysa z nich informację potrzebną podczas weryfikacji hipotez.

Hipoteza zerowa mówi, że ponieważ nie ma związku między zmiennymi, to rozkład wartości statystyki testowej jest taki-to-a-taki (dany określony wzorem). Niestety, SPSS nie pokazuje rozkładów statystyk testowych. Skąd wiadomo, jaki jest ten wzór? Cóż, był to problem tego, który opracowywał test. William Gosset musiał się napracować z testem t-Studenta, aby rozkład wartości statystyki testowej swojego testu znaleźć. Dzięki niemu wiadomo, że jeśli tylko nie ma luki płacowej i średnie zarobki mężczyzn i kobiet są równe, to powinniśmy oglądać taki rozkład wartości statystyki testowej:

Ze względu na zmienność, zamiast wykresu z żółtym, długim i cienkim prostokątem mamy właśnie ten - rozkład t-Studenta. Wiemy o nim, że jest symetryczny, ma nieco cięższe ogony niż rozkład normalny, a jego kształtem rządzi liczba stopni swobody (równa N - 2, czyli liczbie osób badanych pomniejszonej o dwa). Rozkład statystyki testowej to częstość pojawiania się wartości statystyki testowej, tej pojedynczej liczby, do której zostały sprowadzone Twoje dane. Ponadto, kształt tego rozkładu jest właśnie taki, jak wyżej, ponieważ przyjęliśmy, że nie ma różnic w płacach.

Teraz – co z tym rozkładem możemy zrobić? Nie są to surowe dane - ani to rozkład płac kobiet, ani rozkład płac mężczyzn. Histogramy wynagrodzeń wśród obu płci wyglądałyby inaczej. Na przykład jest ich dwa (osobno dla każdej z płci) i nie obejmują wartości ujemnych na osi OX. 

Wychodzi na to, że masz do dyspozycji dwa rodzaje rozkładów: jeden rodzaj to rozkład Twoich danych (czyli surowych wyników osób badanych), a drugi to rozkład przekształconych danych (czyli wartości statystyki testowej aktualnie używanego testu statystycznego).

HIPOTEZA ZEROWA, ROZKŁAD STATYSTYKI TESTOWEJ ... I ISTOTNOŚĆ STATYSTYCZNA — W tej części powiążemy hipotezę zerową i istotność statystyczną. Otóż, omówiony w poprzedniej części rozkład wartości statystyki testowej posłuży do obliczenia p-wartości (p-value), czyli tego, co SPSS nazywa się istotnością statystyczną. Jak to się dzieje? Spójrzmy jeszcze raz na rysunek rozkładu statystyki testowej.

To prawie ten sam rysunek z tym, że teraz dołożyłam wartość statystyki testowej, uzyskaną przez badacza w badaniu - wynosi ona nieco poniżej dwa (różowy punkt na osi OX). Chciałoby się wiedzieć, jakie jest prawdopodobieństwo uzyskania tej wartości. Niestety, nie można po prostu odczytać wartości krzywej nad tym punktem i potraktować jej jako prawdopodobieństwo. W matematyce umówiliśmy się, że rozkłady ciągłe mają taką własność, że prawdopodobieństwo konkretnej wartości statystyki testowej (tego, co leży na osi OX) jest równe zero (mimo, że widzisz coś około jednej dziesiątej). To jest wartość gęstości dla wartości statystyki testowej, ale nie jest to równoznaczne z prawdopodobieństwem - trust me, I'm a mathematician. Wobec tego liczymy pola.

Tu oczywiście wchodzi cała kwestia, jak liczyć owe pole - z lewej strony uzyskanej wartości statystyki testowej? z prawej? obustronnie? Czyli tzw. stronność testu. Zostawimy to teraz, ponieważ zajmujemy się relacją między hipotezą zerową a p-wartością/istotnością statystyczną i dla ułatwienia będziemy liczyć pole z jednej strony (z prawej).

Powierzchnia pola zaznaczona na żółto to p-wartość, w SPSS: istotność statystyczna. Im mniejsze pole, tym bardziej istotny statystycznie wynik. Niestety (trzeci raz w tym poście użyte niestety), język nie jest tutaj naszym sprzymierzeńcem. Jeszcze raz: im mniejsza p-wartość, tym większa istotność statystyczna. Kierunek stopniowania jest odwrotny (mniejsza - większa). Wszystko przez traktowanie p-wartości i istotności statystycznej jako synonimów. Ściśle rzecz ujmując, p-wartość to liczba (pole powierzchni.. to żółte), a istotność statystyczna to stan małej powierzchni tego pola. Gdy powierzchnia tego pola nie przekracza 5%, to wynik testu jest istotny statystycznie.

INTERPRETACJA — Podam teraz dwa wyjaśnienia: to, którego używam (także podczas zajęć) oraz drugie, równoważne. Oba wynikają z tekstu Amerykańskiego Towarzystwa Statystycznego na temat interpretacji p-wartości.
- p-wartość mówi o typowości Twojej wartości statystyki testowej. Innymi słowami, mówi o tym, jak typowe są uzyskane przez Ciebie wyniki, zakładając brak zależności. Jeśli p-wartość jest mniejsza niż 5% (pole powierzchni jest mniejsze niż 5%) a wynik jest istotny statystycznie - wówczas dane są nietypowe dla modelu postulowanego przez hipotezę zerową. Gdy człowiek niesie zakrwawiony nóż, to jest to nietypowe zjawisko dla modelu, że ów człowiek jest niewinny.
- p-wartość świadczy przeciwko hipotezie zerowej. Wyjdźmy od tego, że w ogonach rozkładu znajdują się wyniki nietypowe. To tutaj znajdują się takie wartości statystyki testowej, które dadzą istotność statystyczną. Jeśli p-wartość jest mniejsza niż 5% (pole powierzchni jest mniejsze niż 5%) a wynik jest istotny statystycznie - wówczas wynik statystyki testowej świadczy przeciwko hipotezie zerowej. Upraszczając sprawę – zakrwawiony nóż w rękach świadczy przeciwko niewinności człowieka. Jest to duże uproszczenie, bo hipoteza o niewinności ("ten człowiek jest niewinny") nie jest hipotezą statystyczną, a zwykłym zdaniem, ale przykład ma zilustrować owe świadczenie przeciwko hipotezie zerowej. A teraz przeczytaj uwagę niżej.

UWAGA! P-wartość nie jest to ostatecznym, kategorycznym dowodem na fałszywość hipotezy zerowej. Nie pozwala ona podjąć zero-jedynkowej decyzji, co zrobić z H0. To dlatego nie używamy słowa odrzucić (reject). Jedyne, co możemy powiedzieć to to, że uzyskane przez nas dane są mało kompatybilne z tym, co postuluje hipoteza zerowa. Dalej badacz może wykorzystać wiedzę odnośnie testów statystycznych i ich zachowaniu oraz wielkość efektu, aby przekonać się, czy rzeczywiście jego dane coś pokazują. Pomyśl o tym w ten sposób: rzadki wynik jeszcze nie oznacza stuprocentowej pewności. Wracając do przykładu, być może człowiek był uczniem i niósł zakrawiony nóż na przedstawienie szkolne :-)

W żołnierskich słowach: p-wartość, w języku polskim nazywana istotnością statystyczną, to liczba, która świadczy przeciwko hipotezie zerowej. Trzeba jednak pamiętać o tym, że w dużych próbach, istotne statystycznie są również trywialne efekty (korelacje, różnice, itd.), dlatego tak ważne jest obejrzenie wielkości efektu.