Pokazywanie postów oznaczonych etykietą inference. Pokaż wszystkie posty
Pokazywanie postów oznaczonych etykietą inference. Pokaż wszystkie posty

Czy r = 0.3 to słaba korelacja? Progi Cohena, Guilforda, itd.

WRZESIEŃ 2026| LJK | ~ 1 420 słów | ~ 10 231 znaków |

Odpowiedź na pytanie, czy r = 0.3 to wysoka - czy niska - korelacja, zależy od tego, kogo zapytamy — a właściwie: jakim systemem progów się posłuży. Ta sama wartość, która w jednej klasyfikacji uchodzi za słaby związek, w innej może okazać się umiarkowana, a nawet bliska wysokiej.

Jeśli chcesz dowiedzieć się więcej o tym, jak działa, zobacz obszerny wpis o założeniach i interpretacji korelacji r-Pearsona.

Guilford, Cohen, Bowley, a z polskich nazwisk: Stanisz — każdy z nich zaproponował własny zestaw granic, według których badacz ocenia, jaka jest interpretacja współczynnika korelacji oraz czy otrzymany wynik jest mały, czy duży.

Jak klasyfikacje oceniają wynik r = 0.3?

Bowley, uznawany za pierwszego autora wszelkich progów klasyfikujących wartości współczynnika korelacji, uznałby r = 0.30 za korelację słabą — związek istnieje, ale nie jest specjalnie widoczny. Innymi słowami, choć związek się nie rzuca w oczy, wciąż jest realny. Podobnie oceniłby go wzorujący się na nim Guilford, którego podręczniki do statystyki były bestsellerem w świecie naukowców i upowszechniły jego system progów. Dla Cohena wartość r = 0.3, to już korelacja średnia (u Guilforda taki próg zaczyna się dopiero od 0.4). Stanisz z kolei sklasyfikowałby ją ponownie jako korelację słabą. Porównajmy:

Autor klasyfikacji Podejście / Dziedzina Interpretacja wyniku r = 0.3
Arthur Bowley (1901) Prekursor klasyfikacji efektów Korelacja słaba (związek realny, lecz mało widoczny)
Joy P. Guilford (1942) Psychologia Korelacja słaba (umiarkowana zaczyna się od 0.4)
Jacob Cohen (1998) Psychologia Korelacja umiarkowana 
Andrzej Stanisz (2006) Matematyka / Statystyka medyczna Korelacja słaba (przeciętna zaczyna się od 0.31)

Dlaczego istnieje tak wiele klasyfikacji?

Badacze pewnie ucieszyliby się na wieść o jednej uniwersalnej "rozmiarówce", ale coś takiego po prostu nie istnieje. Powodem jest wysoka zależność od kontekstu — a konkretnie od tego, w jakiej dziedzinie bada się związek między dwiema cechami.

W psychologii, gdzie mierzymy zjawiska tak nieuchwytne jak osobowość czy dobrostan i gdzie na wynik wpływa tysiące czynników naraz, korelacja r = 0.3 to interesujący wynik. W naukach ścisłych czy w części badań ekonomicznych, gdzie zmienne mierzy się precyzyjnie, a badany związek jest w miarę bezpośredni (np. zależność między dawką leku a stężeniem substancji we krwi), tę samą wartość r = 0.3 uznano by za wynik rozczarowująco słaby. Ta sama liczba, różny kontekst, inne wymagania. Dlatego nie ma (i nigdy nie będzie) jednej tabeli klasyfikacji.

Wszystkie powyższe klasyfikacje łączy jedno: każdą z nich arbitralnie stworzył jeden człowiek. Żadnemu z autorów nie można odmówić wiedzy – byli naukowcami, prowadzili badania i na pewno przeanalizowali mnóstwo współczynników korelacji. Wciąż jest to jednak opinie pojedynczej osoby działającej w określonym obszarze nauki. To sprawia, że po pierwsze: nie można przenosić tych klasyfikacji na całą naukę, a po drugie: nawet w obrębie własnych dziedzin pozostają one subiektywnymi ocenami opartymi na indywidualnym doświadczeniu autora.

Ten mankament klasyfikacji dostrzegał nawet sam Cohen. W książce pisał, że jego system progów miał być jedynie ostatnią deską ratunku dla badaczy - mieli do niego sięgać w ostateczności, wówczas, gdy nie mogli odwołać się do żadnego innego badania.

Jak ocenić korelację w psychologii społecznej: Lovakov i Agadullina (2021)

Otrzymany współczynnik korelacji trzeba odnieść do wartości, jakie faktycznie obserwuje się w danej dziedzinie. Dopiero znając rozkład takich współczynników, można powiedzieć, czy nasz własny wynik jest niski, czy wysoki na tle innych. W obrębie psychologii społecznej takiego zadania podjęli się Andriey Lovakov i Elena Agadullina, wyznaczając empiryczny rozkład wartości korelacji publikowanych w tej dziedzinie. Zobacz niżej:

Wykres rozkładu korelacji Lovakov i Agadullina

Ryc. 1. Empiryczny rozkład wartości współczynnika korelacji r w psychologii społecznej. Przedrukowano z: Lovakov & Agadullina (2021). Licencja CC BY 4.0.

Czerwone, przerywane linie pionowe wyznaczają trzy punkty odcięcia (percentyle, dokładniej: kwartyle):

  • 25. percentyl (r = 0.12): Wyznacza próg dla małego efektu. Oznacza to, że tylko 1/4 publikowanych w tej dziedzinie korelacji ma wartość niższą niż 0.12.
  • 50. percentyl (r = 0.24): To mediana, czyli środek wszystkich współczynników korelacji i próg dla średniego (umiarkowanego) efektu. Dokładnie połowa wszystkich obserwowanych w literaturze z zakresu psychologii społecznej współczynników korelacji jest słabsza, a połowa silniejsza niż 0.24.
  • 75. percentyl (r = 0.41): Wyznacza granicę dużego efektu. Wyniki powyżej tej wartości plasują się w najwyższej ćwiartce najsilniejszych zależności, jakie udaje się zaobserwować.

Wykres ten doskonale obrazuje asymetrię prawostronną – większość współczynników korelacji skupia się w przedziale od 0.0 do 0.4. Wyniki powyżej 0.5 (które Cohen uznawał za po prostu „duże”) w realnej nauce zdarzają się niezwykle rzadko.

Ich analiza pokazuje, że nowe progi wielkości dla umiarkowanych i dużych efektów w psychologii społecznej są niższe niż tradycyjne progi Cohena. Dla korelacji umiarkowanej - zamiast 0.3 jest 0.24. Dla korelacji wysokiej - zamiast 0.5 jest 0.41.

Na tle tego empirycznego rozkładu współczynników korelacji spotykanych w psychologii społecznej, umieszczony w czerwonym kółku współczynnik korelacji równy r = 0.3 zostałby uznany za korelację średnią, umiarkowaną.

Gdzie empiryczne progi wielkości efektu mają praktyczne zastosowanie?

Oprócz oceny sił korelacji w przeprowadzonym badaniu, empirycznie wyznaczone progi wielkości efektu można wykorzystać w analizie mocy testu — planując badanie i szacując potrzebną liczebność próby, lepiej oprzeć się na realistycznej wartości efektu niż na podręcznikowej, oderwanej od danej dziedziny. Patrząc przez ten pryzmat, r = 0.3 to nadal korelacja średnia — ale tym razem oparta na faktycznym rozkładzie wyników w psychologii, a nie na arbitralnej konwencji.

A co jeśli nie zajmujesz się psychologią społeczną?

Analiza Lovakova i Agadulliny dotyczy tylko jednej subdyscypliny. W innym obszarze psychologii — a tym bardziej w zupełnie innej dziedzinie nauki — empiryczny rozkład wartości współczynników korelacji może wyglądać zupełnie inaczej. Dlatego zanim ocenisz swój wynik, warto sprawdzić, czy podobna metaanaliza nie powstała już dla Twojej dziedziny. Artykuły zestawiające opublikowane współczynniki korelacji (i nie tylko) istnieją dla coraz większej liczby obszarów badawczych.

Promptem, który możesz wykorzystać, może być odpowiednio sformułowany prompt do wybranego modelu językowego (ChatGPT, Gemini, Claude), np.: "Planuję analizę mocy (power analysis) dla badania korelacyjnego w dziedzinie [TU WSTAW DZIEDZINĘ, np. neuropsychologii / psychologii pracy / pedagogiki].

Chcę uniknąć stosowania ogólnych i często zawyżonych kryteriów Cohena (\(r = .10 / .30 / .50\)). Poszukuję empirycznych wytycznych dotyczących wielkości efektu (effect size benchmarks) specyficznych dla tej konkretnej dyscypliny – dokładnie tak, jak zrobili to Lovakov i Agadullina (2021) dla psychologii społecznej czy Gignac i Szodorai (2016) dla różnic indywidualnych.

Czy istnieją artykuły metanaukowe, metaanalizy lub przeglądy systematyczne, które przeanalizowały rozkład faktycznie obserwowanych współczynników korelacji w literaturze z zakresu [WSTAW DZIEDZINĘ]? Zależy mi na publikacjach, które wskazują empiryczną medianę (50. percentyl) oraz wartości dla małego i dużego efektu w tej konkretnej branży, abym mógł profesjonalnie uzasadnić wybór wielkości efektu do analizy mocy." Dzięki temu dowiesz się, z jak dużym efektem masz do czynienia a także zidentyfikować spodziewaną wielkość efektu w analizie mocy w Twojej działce.

Literatura cytowana

  • Bowley, A. L. (1901). Elements of statistics. P. S. King.
  • Cohen, J. (1988). Statistical power analysis for the behavioral sciences (2nd ed.). Lawrence Erlbaum Associates.
  • Gignac, G. E., Szodorai, E. T. (2016). Effect size guidelines for individual differences researchers. Personality and Individual Differences, 102, 74–78. https://doi.org
  • Guilford, J. P. (1942). Fundamental statistics in psychology and education. McGraw-Hill Book Company.
  • Lovakov, A., Agadullina, E. R. (2021). Empirically derived guidelines for effect size interpretation in social psychology. European Journal of Social Psychology, 51(3), 485–504. https://doi.org/10.1002/ejsp.2752
  • Stanisz, A. (2006). Przystępny kurs statystyki z zastosowaniem STATISTICA PL na przykładach z medycyny. Tom 1: Statystyki podstawowe (wyd. 3). StatSoft Polska.

Często zadawane pytania (FAQ)

Czy korelacja r = 0.3 zawsze oznacza słaby związek?

Nie. W naukach ścisłych i medycznych r = 0.3 uchodzi za wynik niski. Jednak w statystyce w psychologii oraz naukach społecznych, gdzie na ludzkie zachowanie wpływa mnóstwo zmiennych, wartość ta jest uznawana za solidny i bardzo wartościowy efekt (według klasyfikacji Cohena lub progów empirycznych).

Czym różnią się progi Cohena od progów Lovakova i Agadulliny?

Klasyfikacja Cohena opiera się na arbitralnej konwencji i subiektywnej ocenie autora. Z kolei progi Lovakova i Agadulliny to kryteria empiryczne, wyznaczone na podstawie rzeczywistego rozkładu tysięcy współczynników korelacji publikowanych w badaniach z zakresu psychologii społecznej.

Jaki prompt wpisać, aby wyszukać metaanalizy z Twojej dziedziny?

Oto przykładowy prompt: "Znajdź metaanalizy raportujące rozkład wartości współczynników korelacji (r Pearsona) w [nazwa Twojej dziedziny/subdyscypliny]. Wskaż konkretne badania podające progi niskiej, umiarkowanej i wysokiej korelacji." Dzięki temu możesz dowiedzieć się, z jak dużym efektem masz do czynienia a także zidentyfikować spodziewaną wielkość efektu w analizie mocy.

💬 A czy Ty jesteś wierny/a Cohenowi?

Z jakimi kryteriami wielkości efektu najczęściej spotykasz się w swoich badaniach lub na zajęciach? Trzymasz się sztywno progów Cohena, czy w Twojej działce stosuje się już bardziej specyficzne wytyczne? Napisz w komentarzu pod postem!


☕ Zachwycił Cię ten blog i chcesz mnie wesprzeć? Postaw mi kawę w serwisie buycoffee.to. Oto link: buycoffee.to/statystykawpsychologii

Hipoteza zerowa i p-wartość: link pomiędzy nimi.

Jak mają się wyniki istotne statystycznie do hipotezy zerowej? Związek między p-wartością a H0 przedstawiam niżej w trzech aktach.

SPIS TREŚCI:

HIPOTEZA ZEROWA Ogólnie można przyjąć, że hipoteza zerowa mówi o braku związku między zmiennymi (na przykład: brak korelacji, brak różnic między grupami, niezależność dwóch zmiennych).

W większości przypadków taka perspektywa sprawdza się - do czasu jak spotykamy testy normalności.

Weźmy konkretny przykład – różnice międzypłciowe w średnim poziomie zarobków. Chodzi o tzw. gender pay gap. To zjawisko z zakresu ekonomii, które polega na tym, że średni poziom zarobków mężczyzn jest wyższy niż średni poziom zarobków kobiet. Mężczyźni zarabiają więcej niż kobiety na całym świecie. Nie jest to coś, co cieszy, ale badania pokazują, że istnieje w wielu krajach. Dla przykładu, powiedzmy, że chcielibyśmy sprawdzić, jak to jest w Polsce. Mamy zatem dwie kategorie (kobieta/mężczyzna) i zmienną ilościową (wynagrodzenie w złotówkach) – zatem test t-Studenta. Ponadto obserwacje są niezależne, bo trudno losowo przydzielić osoby badane do jednej z dwóch kategorii.

Hipoteza zerowa w teście t-Studenta brzmi H0: μ1 = μ2 Jest to ogólny zapis, pasujący do każdego badania spełniającego wyżej nakreślone warunki. Ponieważ nasz przykład odnosi się do luki płacowej to hipoteza zerowa tutaj brzmi: nie ma różnic między kobietami a mężczyznami w średnim wynagrodzeniu. Można ją zapisać symbolicznie H0: μkobiety = μmężczyźni

Gdyby nie było zmienności, sprawa byłaby prosta - różnica między średnimi zawsze wynosiłaby zero - w każdej z prób - niezależnie, kto badałby ją i w jakim miejscu na Ziemi: czy w Polsce, w Szwecji czy w USA. Zatem bardzo ubogi histogram, a raczej hybryda histogramu i wykresu słupkowego i wyglądałaby tak:

W zdaniach powyżej używam trybu przypuszczającego, ponieważ tak wyglądałby świat bez zmienności. Ta zmienność jest charakterystyczną cechą otaczającego świata. Przecież mężczyźni zarabiają różnie – podobnie jak kobiety. Płace różnią się nawet bez podziału na płeć.  To powoduje, że nawet badając to samo zjawisku, otrzymuje się różne wyniki. Różnica między średnimi zarobkami kobiet i mężczyzn w prawie każdej próbie nie będzie równa zero.

I tu jest właśnie rola statystyki – czy z faktu, że na próbie wyszło, że są różnice, to mogę powiedzieć, że w całej populacji również są różnice? Czy jeśli średnia zarobków kobiet w moim badaniu jest niższa niż średnia zarobków mężczyzn, to jednocześnie w populacji średnia kobiet jest niższa niż średnia zarobków mężczyzn?

HIPOTEZA ZEROWA ... I ROZKŁAD STATYSTYKI TESTOWEJ Hipoteza zerowa robi coś więcej niż tylko siedzi i opowiada o braku związku. Jest to przecież hipoteza statystyczna, a każda hipoteza statystyczna tak naprawdę postuluje pewien rozkład wyników. Jakich wyników? Nie surowych, zebranych przez badacza, znajdujących się w wierszach i kolumnach SPSS-a, ale wyników statystyki testowej. Statystyka testowa to sedno każdego testu statystycznego. Jest to wzór, który przekształca surowe dane – mówiąc metaforycznie, wysysa z nich informację potrzebną podczas weryfikacji hipotez.

Hipoteza zerowa mówi, że ponieważ nie ma związku między zmiennymi, to rozkład wartości statystyki testowej jest taki-to-a-taki (dany określony wzorem). Niestety, SPSS nie pokazuje rozkładów statystyk testowych. Skąd wiadomo, jaki jest ten wzór? Cóż, był to problem tego, który opracowywał test. William Gosset musiał się napracować z testem t-Studenta, aby rozkład wartości statystyki testowej swojego testu znaleźć. Dzięki niemu wiadomo, że jeśli tylko nie ma luki płacowej i średnie zarobki mężczyzn i kobiet są równe, to powinniśmy oglądać taki rozkład wartości statystyki testowej:

Ze względu na zmienność, zamiast wykresu z żółtym, długim i cienkim prostokątem mamy właśnie ten - rozkład t-Studenta. Wiemy o nim, że jest symetryczny, ma nieco cięższe ogony niż rozkład normalny, a jego kształtem rządzi liczba stopni swobody (równa N - 2, czyli liczbie osób badanych pomniejszonej o dwa). Rozkład statystyki testowej to częstość pojawiania się wartości statystyki testowej, tej pojedynczej liczby, do której zostały sprowadzone Twoje dane. Ponadto, kształt tego rozkładu jest właśnie taki, jak wyżej, ponieważ przyjęliśmy, że nie ma różnic w płacach.

Teraz – co z tym rozkładem możemy zrobić? Nie są to surowe dane - ani to rozkład płac kobiet, ani rozkład płac mężczyzn. Histogramy wynagrodzeń wśród obu płci wyglądałyby inaczej. Na przykład jest ich dwa (osobno dla każdej z płci) i nie obejmują wartości ujemnych na osi OX. 

Wychodzi na to, że masz do dyspozycji dwa rodzaje rozkładów: jeden rodzaj to rozkład Twoich danych (czyli surowych wyników osób badanych), a drugi to rozkład przekształconych danych (czyli wartości statystyki testowej aktualnie używanego testu statystycznego).

HIPOTEZA ZEROWA, ROZKŁAD STATYSTYKI TESTOWEJ ... I ISTOTNOŚĆ STATYSTYCZNA — W tej części powiążemy hipotezę zerową i istotność statystyczną. Otóż, omówiony w poprzedniej części rozkład wartości statystyki testowej posłuży do obliczenia p-wartości (p-value), czyli tego, co SPSS nazywa się istotnością statystyczną. Jak to się dzieje? Spójrzmy jeszcze raz na rysunek rozkładu statystyki testowej.

To prawie ten sam rysunek z tym, że teraz dołożyłam wartość statystyki testowej, uzyskaną przez badacza w badaniu - wynosi ona nieco poniżej dwa (różowy punkt na osi OX). Chciałoby się wiedzieć, jakie jest prawdopodobieństwo uzyskania tej wartości. Niestety, nie można po prostu odczytać wartości krzywej nad tym punktem i potraktować jej jako prawdopodobieństwo. W matematyce umówiliśmy się, że rozkłady ciągłe mają taką własność, że prawdopodobieństwo konkretnej wartości statystyki testowej (tego, co leży na osi OX) jest równe zero (mimo, że widzisz coś około jednej dziesiątej). To jest wartość gęstości dla wartości statystyki testowej, ale nie jest to równoznaczne z prawdopodobieństwem - trust me, I'm a mathematician. Wobec tego liczymy pola.

Tu oczywiście wchodzi cała kwestia, jak liczyć owe pole - z lewej strony uzyskanej wartości statystyki testowej? z prawej? obustronnie? Czyli tzw. stronność testu. Zostawimy to teraz, ponieważ zajmujemy się relacją między hipotezą zerową a p-wartością/istotnością statystyczną i dla ułatwienia będziemy liczyć pole z jednej strony (z prawej).

Powierzchnia pola zaznaczona na żółto to p-wartość, w SPSS: istotność statystyczna. Im mniejsze pole, tym bardziej istotny statystycznie wynik. Niestety (trzeci raz w tym poście użyte niestety), język nie jest tutaj naszym sprzymierzeńcem. Jeszcze raz: im mniejsza p-wartość, tym większa istotność statystyczna. Kierunek stopniowania jest odwrotny (mniejsza - większa). Wszystko przez traktowanie p-wartości i istotności statystycznej jako synonimów. Ściśle rzecz ujmując, p-wartość to liczba (pole powierzchni.. to żółte), a istotność statystyczna to stan małej powierzchni tego pola. Gdy powierzchnia tego pola nie przekracza 5%, to wynik testu jest istotny statystycznie.

INTERPRETACJA — Podam teraz dwa wyjaśnienia: to, którego używam (także podczas zajęć) oraz drugie, równoważne. Oba wynikają z tekstu Amerykańskiego Towarzystwa Statystycznego na temat interpretacji p-wartości.
- p-wartość mówi o typowości Twojej wartości statystyki testowej. Innymi słowami, mówi o tym, jak typowe są uzyskane przez Ciebie wyniki, zakładając brak zależności. Jeśli p-wartość jest mniejsza niż 5% (pole powierzchni jest mniejsze niż 5%) a wynik jest istotny statystycznie - wówczas dane są nietypowe dla modelu postulowanego przez hipotezę zerową. Gdy człowiek niesie zakrwawiony nóż, to jest to nietypowe zjawisko dla modelu, że ów człowiek jest niewinny.
- p-wartość świadczy przeciwko hipotezie zerowej. Wyjdźmy od tego, że w ogonach rozkładu znajdują się wyniki nietypowe. To tutaj znajdują się takie wartości statystyki testowej, które dadzą istotność statystyczną. Jeśli p-wartość jest mniejsza niż 5% (pole powierzchni jest mniejsze niż 5%) a wynik jest istotny statystycznie - wówczas wynik statystyki testowej świadczy przeciwko hipotezie zerowej. Upraszczając sprawę – zakrwawiony nóż w rękach świadczy przeciwko niewinności człowieka. Jest to duże uproszczenie, bo hipoteza o niewinności ("ten człowiek jest niewinny") nie jest hipotezą statystyczną, a zwykłym zdaniem, ale przykład ma zilustrować owe świadczenie przeciwko hipotezie zerowej. A teraz przeczytaj uwagę niżej.

UWAGA! P-wartość nie jest to ostatecznym, kategorycznym dowodem na fałszywość hipotezy zerowej. Nie pozwala ona podjąć zero-jedynkowej decyzji, co zrobić z H0. To dlatego nie używamy słowa odrzucić (reject). Jedyne, co możemy powiedzieć to to, że uzyskane przez nas dane są mało kompatybilne z tym, co postuluje hipoteza zerowa. Dalej badacz może wykorzystać wiedzę odnośnie testów statystycznych i ich zachowaniu oraz wielkość efektu, aby przekonać się, czy rzeczywiście jego dane coś pokazują. Pomyśl o tym w ten sposób: rzadki wynik jeszcze nie oznacza stuprocentowej pewności. Wracając do przykładu, być może człowiek był uczniem i niósł zakrawiony nóż na przedstawienie szkolne :-)

W żołnierskich słowach: p-wartość, w języku polskim nazywana istotnością statystyczną, to liczba, która świadczy przeciwko hipotezie zerowej. Trzeba jednak pamiętać o tym, że w dużych próbach, istotne statystycznie są również trywialne efekty (korelacje, różnice, itd.), dlatego tak ważne jest obejrzenie wielkości efektu.

Testy parametryczne i nieparametryczne

CZERWIEC 2024| LJK | ~650 słów


Kryteria podziału testów są różne. Testy różnic - i testy związków. Testy kierunkowe - i bezkierunkowe. Istnieje też podział na testy parametryczne i nieparametryczne. Mogłoby się wydawać, że ten podział zależy od treści hipotezy zerowej (czy dotyczy konkretnego parametru, czy też nie), ale sedno podziału tkwi zupełnie gdzieś indziej.


Wprowadzenie

Jak pewnie wiesz, klasyczne testy statystyczne to maszynki do mielenia danych. Jak każda maszynka, do prawidłowego zadziałania wymaga ona materiału odpowiedniej jakości. Po to, aby w ogóle uruchomić się, lub dobrze zadziałać. Testy statystyczne są pod tym względem bardzo podobne. Cyferki, które są bazie są dla takiego testu tym, czym surowy materiał dla maszynki do mielenia mięsa. Jest przeznaczona do mielenia mięsa, ale zmieli też i warzywa. Kamieni już nie zmieli. Podobnie zachowują się testy. Test nie wie, co symbolizują dane, którymi karmi go badacz. Te jedynki i dwójki mogą reprezentować zarówno ilościową zmienną np. liczbę rodzeństwa, albo zmienną jakościową np. płeć. Z tego powodu, zanim uruchomi się test statystyczny, należy sprawdzić czy dane są odpowiedniej jakości. Czy test, który gdzieś wewnątrz mechanizmu oblicza średnią arytmetyczną, otrzyma dane ilościowe - bo tylko taki typ zmiennej uprawnia do zastosowania testu.

Proces sprawdzania jakości danych nazywa się założeniami testu. Założenia różnych testów są siłą rzeczy różne. Mogą być mniej lub bardziej specyficzne. Na przykład test chi-kwadrat wymaga, aby dane miały jakościowy charakter - i to wszystko. Inny znany test, test t-Studenta dla dwóch prób niezależnych (ang. two-sample t-test independent) ma całą listę wymagań - nie tylko wymaga, aby jedna ze zmiennych była ilościowa, ale również żąda, aby wartości tej zmiennej ilościowej pojawiały się zgodnie z częstością rozkładu normalnego (tj. aby rozkład zmiennej był rozkładem normalnym) i to w obu kategoriach zmiennej jakościowej na raz. To z kolei bardzo duże wymaganie. Czym zatem różni się jeden test od drugiego? Przecież nie może chodzić tylko i wyłącznie o liczbę założeń.


Parametryczność i nieparametryczność testu

I tu wchodzi pewien typ podziału testów pod względem oczekiwań wobec danych. Ten podział przebiega wzdłuż tego, czy dany test wymaga, aby rozkład zmiennej (lub zmiennych) był określonej postaci. Pisząc :"określonej postaci", mam na myśli dokładną postać funkcyjną. Nie chodzi tu posiadanie konkretnej własności takiej jak symetria czy jednomodalność (posiadanie jednej mody) a konkretny wzór rozkład łączący wartości zmiennej z szansami ich wystąpienia. Najczęściej możesz spotkać się z rozkładem normalnym, ale to nie jest jedyny opisany rozkład, jest ich całe mnóstwo - eksponencjalny, Pareto, itd.

Poniższa grafika przedstawia kilka popularnych testów statystycznych przydzielonych do jednej z dwóch kategorii


 

W ten sposób testy parametryczne to takie, które żądają, aby rozkłady zmiennych były konkretne, precyzyjnie określone. W przeciwieństwie do nich testy nieparametryczne nie żądają konkretnej postaci rozkładu. Nie znaczy to jednak, w ogóle nie mają żadnych założeń i można do ich maszynek włożyć dane dowolnego typu i kształtu.


Test U Manna-Whitney'a jako przykład testu nieparametrycznego z założeniami

Świetnym przykładem tego, że traktowanie testu nieparametrycznego jako pozbawionego założeń może prowadzić do błędnych wniosków, jest test U-Manna-Whitney'a. Jest to zamiennik testu t-Studenta dla dwóch grup niezależnych, gdy badacz ma wyrzuty sumienia z powodu zastosowania testu pierwszego wyboru. - Masz małą liczebność próby? Zastosuj test U Manna-Whitney'a. - Masz nierównoliczne grupy? Zastosuj test U Manna-Whitney'a. - Problem z normalnością zmiennej? Zastosuj test U Manna-Whitney'a.

W ten sposób badacz uczy się bezwarunkowego odruchu. Nie trzeba dodawać, że w statystyce bezwarunkowe odruchy nie są najlepszymi odruchami. Wszystko dlatego, że test U-Manna-Whitney'a bywa zamiennikiem testu t-Studenta dla dwóch grup niezależnych, o ile stopień rozproszenia danych jest zbliżony (tj. wariancje są homogeniczne). W przeciwnym wypadku odpowiada jedynie na pytanie, czy szansa na zaobserwowanie wyższych wartości zmiennej zależnej z jednej kategorii od wartości tej samej zmiennej z drugiej kategorii jest taka sama jak szansa na zaobserwowanie wyższych wartości (w odwrotnej kolejności kategorii). Ponieważ czuję, że kompletnie nie wychodzi mi słowny opis matematycznego zapisu P(X > Y) = P(X < Y) (a tak dokładnie brzmi hipoteza zerowa tego testu), dla jasności posłużę się przykładem.

Szansa na zaobserwowanie wyższej empatii u kobiet niż u mężczyzn jest taka sama jak szansa na zaobserwowanie wyższej empatii u mężczyzn niż u kobiet - tak brzmiałaby hipoteza zerowa testu U-Manna Whitney'a w badaniach nad związkami empatii i płci. To zupełnie inna para kaloszy niż średnie nasilenie zmiennej empatia u kobiet jest równe średniemu nasileniu zmiennej empatia u mężczyzn.

Test t-Studenta dla dwóch grup zależnych (ang. two-sample t-test)

LISTOPAD 2023 | LJK | ~2300 słów

Test t-Studenta dla grup zależnych (ang. t-Student's test for paired/dependent/matched data) to test wykorzystywany do porównania średnich nasileń zmiennej ilościowej w przypadku, gdy zebrane obserwacji można połączyć w pary. Wyniki w parze dotyczą tej samej zmiennej ilościowej.



SPIS TREŚCI:

Wprowadzenie

PORÓWNANIA MIĘDZY DWIEMA ŚREDNIMI nasileniami pewnej zmiennej (np. wzrostu, samooceny, introwersji, empatii, narcyzmu) to popularny schemat badawczy, w którym dane pochodzą z porównania dwóch różnych grup (np. kobiety vs. mężczyźni) albo z porównania tej samej grupy badanych przed i po działaniu czynnika eksperymentalnego (np. przed podaniem środka pobudzającego i po; przed zadziałaniem bodźca i po nim). Bardzo często takie dane analizuje się za pomocą testu t-Studenta. W statystyce istnieją dwie wersje tego testu - dla grup niezależnych i dla zależnych. Wersja, jaką wybierzemy, zależy od tego, jak zebraliśmy dane - czy wyniki pomiarów pochodzą od jednostek badanych jeden raz, czy może dwukrotnie.

Gdy badana cecha jest mierzona w obrębie dwóch różnych, wykluczających się kategorii np.:
kobieta i mężczyzna (nie można być i kobietą, i mężczyzną na raz), dane są nazywane niezależnymi i do ich analizy służy test t-Studenta dla grup niezależnych KLIK. Z kolei, gdy ta sama grupa osób badanych przechodzi przez pierwszy i drugi warunek badania, np. pretest i posttest, wówczas dane nazywa się zależnymi i do ich analizy służy test t-Studenta dla grup zależnych. W tym poście zajmiemy się tym drugim przypadkiem.

To oczywiście bardzo duże uproszczenie pojęcia. Zależność obserwacji oraz jej brak, czyli niezależność jest czymś więcej niż tylko krotnością brania udziału w badaniu przez jednostki badanie.

TEST t-STUDENTA dla zależnych grup (albo par obserwacji) znajduje zastosowanie w prostych eksperymentach: najpierw mierzymy wyjściowy poziom interesującej nas zmiennej,  potem osoby badane poddajemy działaniu eksperymentalnemu (np. obejrzeniu filmu mającego wywołać określone emocje, spożyciu jakiś specyfiku, wyobrażeniu sobie czegoś). Następnie znowu mierzymy poziom tej samej zmiennej, na którą to działanie eksperymentalne miało mieć wpływ. Tym samym chcemy sprawdzić, czy eksperyment coś zmienił, czyli to działanie terapeutyczne wprowadziło coś nowego. Do analiz wyników, jakie powstają dzięki temu działaniu, służy właśnie ten test.


Hipoteza zerowa H0

Hipoteza zerowa H0 w teście t-Studenta dla prób zależnych mówi o równości średnich nasileń zmiennej zależnej dokonanych między dwoma pomiarami. Na przykład średni poziom stresu (mierzony stężeniem kortyzolu we krwi) przed i po zadziałaniu bodźca. Jej symboliczny zapis jest następujący. Grecka litera μ1 oznacza średnie nasilenie badanej cechy w pierwszym pomiarze, a μ2 oznacza średnie nasilenie badanej cechy w drugim pomiarze:

H0: μ1 = μ2

Zauważ, że treść tej hipotezy zerowej w teście t-Studenta dla prób zależnych przypomina hipotezę zerową testu t-Studenta dla prób niezależnych - tam również można było ją zapisać w sposób identyczny z powyższym. Różnica polega na tym, że teraz indeksy oznaczają co innego. Poprzednio, indeks dolny oznaczał numer poziomu czynnika, np. 1 = kobiety, 2 = mężczyźni. Tym razem jest to kolejność pomiaru. 1 oznacza pierwszy pomiar, a 2 - drugi pomiar. Pamiętaj, w teście t-Studenta dla grup zależnych to jest ta sama grupa osób badanych, więc dwukrotnie mierzymy średni poziom tej samej zmiennej między pomiarami.

JAK INTERPRETOWAĆ TREŚĆ H0? | Ogólnie rzecz biorąc, w procedurze klasycznego testowania istotności statystycznej hipotezy zerowej H0, hipoteza zerowa mówi o braku efektu. Chcąc przykroić ją na potrzeby dwukrotnego pomiaru tej samej zmiennej ilościowej, ów brak efektu możemy rozumieć jako niepowodzenie w manipulacji eksperymentalnej. Innymi słowy, manipulacja nie przyniosła pożądanego efektu: wyniki zmiennej zależnej ani średnio nie wzrosły, ani średnio nie spadły, wciąż pozostając mniej więcej na tym samym poziomie.

BŁĘDY W ZAPISIE H0 | W sformułowaniu tej hipotezy wcale nie chodzi o równość dwóch średnich arytmetycznych w dwóch zebranych próbach - dotyczy ona populacji, dlatego widzisz greckie znaczki sygnalizujące nasilenie cechy na wyższym poziomie niż próba.

Pamiętaj, że równość średnich wyrażona w hipotezie zerowej nigdy nie dotyczy równości średnich w próbie. Dlatego nie piszemy H0: x̄1 = x̄2 Do celu sprawdzenia, czy te średnie x̄1 i x̄2 są równe, wystarczy spojrzeć na statystyki opisowe.

A teraz będą dziać się czary. Tak naprawdę w trakcie wykonywania analiz, test t-Studenta dla powtarzanych pomiarów zmienia się w najprostszą z tych testów wersję.

TRANSFORMACJA DANYCH SUROWYCH | W teście t-Studenta dla zależnych, jeszcze zanim dane wejdą do analiz, przechodzą pewną przemianę - transformację. Polega ona na odjęciu wyników z drugiego pomiaru od wyników z pierwszego pomiaru, czyli na obliczeniu różnicy między pomiarami. Dwa zestawy wyników zostają sprowadzone do jednego zestawu - zawierającego różnice. Dla każdej obserwacji zostaje obliczona różnica między pomiarami. W ten sposób test t-Studenta dla dwóch grup zależnych staje się jednopróbowym testem t-Studenta (ang. one-sample t-test), takim najprostszym testem, w którym średnia jednej zmiennej jest porównywana do jakiejś wartości referencyjnej. Taki test jest stosowany np. w analizie, której celem jest sprawdzić czy wybrana kategoria badanych ma określony średni poziom interesującej Cię cechy, np. μ = 120 Hg (ciśnienie skurczowe) u cukrzyków.

Jak to się dzieje, że test t-Studenta dla grup zależnych staje się testem t-Studenta dla jednej grupy? Wszystko właśnie przez tę transformację. Zobacz, przenosząc średnią zmiennej zależnej drugiego pomiaru μ2 z prawej na lewą stronę, otrzymujemy różnicę średnich między pomiarami μ1 - μ2. Wyrażenie po lewej stronie zostaje porównane do zera μ1 - μ2 = 0.

HIPOTEZA ZEROWA W NOWEJ ODSŁONIE | Ponieważ wykonaliśmy operację na surowych danych i zmieniliśmy ich strukturę, hipoteza zerowa również zmieni postać. Zamiast porównywać średnie oryginalnej zmiennej w dwóch pomiarach, teraz porównujemy bezpośrednio do zera średnią różnic zmiennej zależnej między dwoma pomiarami. Oto nowa postać hipotezy zerowej:

H0: μD = 0

JAK TO ROZUMIEĆ? | Ten zapis oznacza, że oczekujemy, aby w populacji średnia różnic była równa zero. Średnio jednak nie znaczy, że wszyscy na raz. Nie oczekujemy, że dla każdej potencjalnej jednostki różnica nasilenia zmiennej zależnej między pomiarami będzie wynosić dokładnie zero. Chodzi o to, aby różnice były najczęściej blisko zera, zaś wyniki coraz to dalsze od niego, pojawiały się coraz rzadziej.

Hipoteza alternatywna H1

HIPOTEZA ALTERNATYWNA W NHST | Hipoteza alternatywna H1 w paradygmacie NHST często wygląda bardzo mgliście. Z grubsza, można ją zapisać:”H1 nieprawda, że H0”, więc zaprzeczenie H1: μ1 ≠ μ2 oznacza brak równości między średnimi zmiennej zależnej między pomiarami. Gwoli ścisłości, ponieważ zajmujemy się średnimi różnic, równie dobrze moglibyśmy napisać H1: μD ≠ 0

Często hipotezę alternatywną H1 traktuje się jako statystyczny odpowiednik hipotezy badawczej. Odpowiednik, ponieważ jest przełożeniem hipotezy badawczej na język symboli statystycznych. Badacz zazwyczaj ma sprecyzowany kierunek zależności. Oczekuje konkretnej nierówności między średnimi, np. że po poddaniu osoby badane działaniu jakiegoś bodźca nastąpi wzrost wyników. To powoduje, że hipoteza alternatywna również dotyczy średnich nasileń (poziomów) tej samej zmiennej zależnej między dwoma pomiarami, a znak arytmetyczny jaki stoi pomiędzy mógłby być znakiem mniejszości, większości, albo nierówności. W ten sposób mamy trzy warianty hipotezy alternatywnej H1:

  • LEWOSTRONNA H1: μ1 < μ2 — np. pod wpływem działania eksperymentalnego wzrasta średnie nasilenie badanej zmiennej
  • OBUSTRONNA H1: μ1 ≠ μ2 — np. działanie eksperymentalne zmienia średnie nasilenie badanej zmiennej, ale nie wiadomo, czy podwyższa, czy obniża
  • PRAWOSTRONNA H1: μ1 > μ2 — np. pod wpływem działania terapeutycznego spada średnie nasilenie badanej zmiennej. 

ZAŁOŻENIA TESTU t-STUDENTA DLA GRUP ZALEŻNYCH
Każdy test statystyczny dane powinny mieć odpowiedni format, aby dało się ten test zastosować. Te wymogi nazywają się
założeniami testu.

FORMAT DANYCH | Zanim poznamy wymogi, przypomnę, że oględzinom poddajemy nie dane z obu pomiarów, a wynik ich transformacji, czyli różnice między pomiarami. Jak wyżej mówiliśmy, hipoteza zerowa o braku różnic między średnimi wartościami w pomiarach H0: μ1 = μ2 stała się hipotezą zerową o zerowej średniej różnicy między pomiarami H0: μD = 0. Tu koncentrujemy się na nowym, pojedynczym zestawie wyników (różnicach między pomiarami). Dzięki temu, z różnych możliwych oczekiwań co do do rozkładu zmiennej zależnej zostanie nam tylko jedyna (spoiler: normalność rozkładu).

NORMALNOŚĆ ROZKŁADU (RÓŻNIC) | Kiedy przekształcimy dane z dwóch kolumn i powstanie nam trzecia kolumna, będzie ona zmienną, której normalność badamy. Wygląda na to, że badamy normalność rozkładu nie surowych wyników - dwóch odrębnych zmiennych - a różnic między pomiarami. Badanie normalności oznacza, że badamy, czy występowanie poszczególnych wyników jest podyktowane prawem rozkładu normalnego. Rozkład normalny to specyficzny przepis na pojawianie się obserwacji. Mówi on, że najczęściej będą pojawiać się wyniki z okolicy średniej, a czym "dziwniejsza" obserwacja, tym mniejsza szansa, że wystąpi.

➡️ Jeśli chcesz dowiedzieć się, jak diagnozować normalność tymi metodami, zajrzyj do posta pt. Diagnostyka normalności: KLIK

HOMOGENICZNOŚĆ WARIANCJI | W porównaniu z testem t-Studenta dla niezależnych, w wariancie tego testu dla grup zależnych, nie obowiązuje nas badanie homogeniczności wariancji badanej cechy. Skupiając się na różnicach między pomiarami, skupiamy się na jednym zestawie danych. Pewnie nikt nie zauważył, jak gładko przeszliśmy z testu t-Studenta dla dwóch prób do testu t-Studenta dla jednej próby. Tak - test t-Studenta dla prób zależnych to tak naprawdę test t-Studenta dla jednej próby (one sample t-test), gdzie tą jedną próbą są różnice. Nie ma grup, w których mielibyśmy porównywać wariancje. Zostaje tylko badanie normalności rozkładu, ale różnic między pomiarami.

POWSTAWANIE STATYSTYKI TESTOWEJ TESTU t-STUDENTA (DLA GRUP ZALEŻNYCH)

ZACHOWANIE ŚREDNIEJ RÓŻNIC | Zanim omówimy statystykę testową – a potem jej rozkład – zastanówmy się dlaczego nie moglibyśmy po prostu porównywać średnich? W pojedynczej kolumnie, w każdym z jej wierszy znajduje się różnica między pomiarem pierwszym i drugim dla każdej osoby badanej. Pamiętasz, wcześniej mówiliśmy o transformacji danych. Wówczas zrezygnowaliśmy z surowych danych i została nam jedna kolumna z transformowanymi danymi tj. z różnicami między pomiarami. Co by się teraz stało, gdybyśmy policzyli średnią arytmetyczną tych różnic? Czego moglibyśmy spodziewać się po tej liczbie?

Gdyby średnia arytmetyczna różnic wynosiła 0, oznaczałoby to, że – średnio rzecz biorąc – manipulacja eksperymentalna nie przyniosła żadnego efektu. Wyniki w drugim pomiarze są ogólnie (średnio) takie same jak w pierwszym. Nie znaczy to oczywiście, że każda osoba ma dwa jednakowe wyniki w obu pomiarach (np. tu i tu 5), ale że średnie arytmetyczne oryginalnej zmiennej zależnej w obu pomiarach są równe.

Ktoś mógłby powiedzieć: niech ta średnia różnic będzie statystyką testową testu t-Studenta dla zależnych. Problem jednak jest taki sam, jak w teście t-Studenta dla niezależnych. Średnia arytmetyczna nie wykrywa rozproszenia wyników. Tę samą średnią arytmetyczną mogą mieć zbiory o dużym rozproszeniu, jak i o małym rozproszeniu, a stopień rozproszenia to ważna informacja. Uczeń, który ma same tróje jest bardziej stabilnym uczniem niż taki, który ma albo 1 albo 5. Trzeba wykonać jedno małe działanie, aby uwzględnić zmienność wyników, średnia arytmetyczna jest dzielona przez błąd standardowy średniej.

POWSTAWANIE STATYSTYKI TESTOWEJ | Wszystkie warianty testu t-Studenta posiadają tę samą ideę statystyki testowej. Punktem wyjścia do jej stworzenia było to, że nie można polegać tylko i wyłącznie na porównywaniu średnich. Zwykła różnica między średnimi nie oddaje tak tego, co naprawdę dzieje się w danych. Rozwiązaniem jest jest odejściu od surowych wyników poprzez tzw. studentyzację.

Statystyka testowa t-Studenta

Technicznie rzecz biorąc, studentyzacja średniej arytmetycznej to nic innego jak podzielenie średniej przez jej błąd standardowy (ang. standard error, SE). Po prawej stronie widzisz przepis na tę statystykę testową. Mała litera t oznacza wartość statystyki testowej t-Studenta, która powstaje przez podzielenie średniej różnic x̄d przez błąd standardowy średniej (który sam jest ilorazem odchylenia standardowego s i liczby obserwacji n).

CO TO JEST BŁĄD STANDARDOWY ŚREDNIEJ? | Zauważmy, że średnia arytmetyczna w próbie jest tylko pewnym oszacowaniem średniej w populacji. O ile nie mamy przebadanej całej populacji, musimy się pogodzić z dozą niepewności wynikającą z faktu, że posiadamy wiedzę tylko o wycinku populacji. Ta miara niepewności to właśnie błąd standardowy.

Błąd standardowy średniej mówi o tym, jak dobrym oszacowaniem średniej w populacji μ jest uzyskana w próbie średnia arytmetyczna x̄. Na ten błąd składają się dwie rzeczy: stopień rozproszenia wyników w formie odchylenia standardowego s oraz liczba jednostek badanych n. Dlaczego tak? Nawet na chłopski rozum można wywnioskować, że stopień rozproszenia jednostek wpływa na zawartość informacyjną naszej próby. Im bardziej skoncentrowane wokół średniej wyniki, tym bardziej precyzyjny wynik. Im bardziej rozstrzelone - tym mniej. Równie dobrze to samo można powiedzieć o liczbie osób badanych. Im więcej jednostek badanych, tym bardziej precyzyjne są nasze wskaźniki. Zaś im bardziej rozproszone wyniki osób badanych, tym mniejsza precyzja.

CO DAJE STUDENTYZACJA? | Kiedy podzieli się średnią arytmetyczną przez jej błąd standardowy, otrzymamy nową liczbę, która będzie działać jak wskaźnik tego, jak wiele informacji znajduje się w próbie - w stosunku do szumu, który zawiera każda próba. Jak wiemy, zmienność wyników osób badanych ma dwa źródła - albo jest efektem manipulacji eksperymentatora (a to wyraża się w średniej arytmetycznej) - albo efektem przypadku. Studentyzacja pozwala zbadać stosunek jednej do drugiej.

O CZYM MÓWI WARTOŚĆ STATYSTYKI TESTOWEJ t-STUDENTA? | Już sama wartość statystyki testowej t-Studenta jest w stanie nam powiedzieć, co stało się w danych. Jaką wartość możemy zobaczyć? Statystyka testowa t-Studenta przyjmuje wartości od minus nieskończoności do plus nieskończoności. Przykładowo, możesz zobaczyć dodatnią t = +3.4, ujemną t = -0.58 oraz zerową t = 0.00. Nie każda wartość statystyki ma taką samą wagę.

Jak można domyślić się, gdy statystyka testowa t-Studenta wynosi zero, t = 0.00, wówczas średnia w pierwszym pomiarze jest taka sama jak średnia w drugim pomiarze. To bardzo mocny znak tego, że celowe działanie badacza - manipulacja eksperymentalna czy zastosowany bodziec - nie wywołuje żadnej reakcji u osób badanych.

Czy w takim razie wszystkie wartości różne od zera oznaczają, że średnie różnią się? Jeszcze nie. Na szczęście, jest pewna reguła. Wokół zera rozciąga się przedział wartości statystyki testowej t-Studenta, który sygnalizuje, że w danych nic nie ma. Jego granicami są: - 1 i +1. Jeśli wartość statystyki t znajdzie się w przedziale [-1, 1], wówczas dla badacza jest to znak, że zaprojektowana przez badacza manipulacja eksperymentalna nie zadziałała. Ściślej rzecz biorąc, może i zadziałała, ale jej działanie jest zbyt słabe, aby test mógł to wykryć. Na jednych zajęciach studentka ochrzciła ten przedział mianem przedziału śmierci. Zabawna nazwa, ale jednak coś w tym określeniu jest - coś, co sprawia, że ono tak dobrze pasuje. Faktycznie, te wartości statystyki testowej, które znajdą się w nim, np. t = - 0.58 albo t = 0.31, zdradzają, że w badaniu nic nie wyszło, że średnie nasilenie badanej zmiennej w pierwszym pomiarze jest bardzo zbliżone do średniego nasilenia zmiennej w drugim pomiarze. Jednocześnie, możesz być prawie pewien, że test pokaże wynik nieistotny statystycznie.

Za to im dalej od tych granicznych wartości -1 i +1, tym lepiej. Im wyższa liczbowa (tj. bez względu na znak) wartość statystyki testowej t-Studenta, tym bardziej bodziec zadziałał na osoby badane. Co więcej, im dalej od tych wartości, tym niższa p-wartość. Najczęściej będziesz obserwować istotność statystyczną w teście.

Pamiętaj, że zajmujemy się zjawiskami empirycznymi, w których wyniki są naznaczonymi przypadkową losowością. Zróżnicowanie naszych danych ma dwa podstawowe źródła: przypadek oraz faktyczne efekty zamierzonych działań badacza. Klasyczne testowanie polega na oddzieleniu jednego od drugiego i celem statystyki testowej jest zbadanie jak wiele zmienności wyników, których źródłem jest eksperyment, zawierają nasze dane. Odbywa się to właśnie za pomocą statystyki testowej. W ten sposób klasyczne statystyki testowe ujawniają ilość informacji zawartej w danych w stosunku do wszechobecnego w świecie czysto losowego szumu.

Gdy już wiemy, jak połączyć informację z danych i wyrazić ją w postaci statystyki testowej, zwanej statystyką t-Studenta i wiemy, co ona sama do nas mówi, pojawia się kolejne pytanie - jak często zdarza się otrzymana w danym badaniu wartość statystyki testowej? Czy wartość t = -0.58 jest rzadka, czy częsta? Odpowiedź na to pytanie kryje się w rozkładzie wartości statystyki testowej, który nosi tę samą nazwę co sam test i jego statystyka: rozkład t-Studenta.

ROZKŁAD, CZYLI JAK CZĘSTO ZDARZA SIĘ OTRZYMANA W BADANIU WARTOŚĆ STATYSTYKI TESTOWEJ? | W statystyce klasycznej istnieje określony sposób postępowania podczas weryfikacji hipotez. Mamy bazę danych, której wyniki mają posłużyć do weryfikacji postawionej hipotezy badawczej. Ponieważ będziemy dokonywać wnioskowania o całej populacji, to musimy wyjść poza zwykły opis próby i sięgnąć po bardziej zaawansowane narzędzia niż statystyki opisowe. Pomysł jest taki, że sprawdzić, jak prawdopodobne są te wyniki. Co mam na myśli, używając w poprzednim zdaniu słowa: "wyniki"? Oczywiście, nie może już chodzić o surowe dane osób badanych - te, które są w bazie danych. Mogłoby chodzić o różnicę między pomiarami, ale tym razem chodzi o coś dalej. O wartość statystyki testowej, która też jest transformacją danych. Jak widzisz, testowanie polega na ciągłym przekształcaniu danych. To tutaj zadajemy pytanie, jak prawdopodobna jest uzyskana w teście wartość statystyki testowej t-Studenta. I tu wchodzimy na kolejny krąg statystycznego wtajemniczenia: nie da się tak po prostu spytać o prawdopodobieństwo jakiegoś wyniku testu.

Chodzi o kontekst. Zdarzenia są bardziej prawdopodobne w jednym kontekście, i mniej prawdopodobne w innym. Pytanie o to, jak często pojawia się konkretna wartość statystyki testowej, np. t = -0.58 albo t = 0.31, odbywa się również w pewnym kontekście. W przypadku klasycznego testowania, jest to przyjęcie założenia o prawdziwości hipotezy zerowej H01 = μ2.

A więc, tak naprawdę zadajemy następujące pytanie: jeśli nie byłoby różnic między pomiarami, to jak prawdopodobna jest uzyskana wartość statystyki testowej t-Studenta? Inaczej mówiąc, jeśli manipulacja eksperymentalna nie działa, to jak typowa jest uzyskana wartość statystyki testowej t?

Na to pytanie odpowiada się za pomocą rozkładu wartości statystyki testowej. W tym wariancie testu t-Studenta jest to rozkład t-Studenta.

KAŻDY ROZKŁAD OPOWIADA PEWNĄ HISTORIĘ... Mówi nam o tym, co będziemy obserwować pod kątem badanej cechy. Które wartości będą występować częściej, które rzadziej. Te, które badacz będzie obserwować częściej, to te, nad którymi widzimy szczyt rozkładu tworzący górkę. Te, które rzadziej będą się pojawiać, to te, które leżą w ogonach rozkładu. Wiedząc to wszystko, przeanalizujmy kształt rozkładu statystyki testowej testu t-Studenta dla grup zależnych.

Oceniając, które wartości statystyki testowej są typowe, a które nie, pamiętaj o tym, że przyjęliśmy założenie o prawdziwości hipotezy zerowej H0.

Rozkład wartości statystyki testowej t-Studenta. Nad szarym przedziałem śmierci od -1 do + 1 widzimy najwyższy punkt rozkładu - szczyt. Gdy hipoteza zerowa jest prawdziwa, to najczęściej spodziewamy się właśnie takich wartości, które sygnalizują, że w danych nic nie ma.

Rozkład t-Studenta, który widzimy na rysunku, mówi, że jeśli bodziec nie zadziałał i pomiary jednostek są podobne, to powinniśmy najczęściej obserwować wartości bliskie zero. Zobacz na powyższym rysunku, że nad przedziałem śmierci, znajduje się szczyt rozkładu. Łącznie, wartości z tego przedziału zgarniają największą szansę wystąpienia. Im bardziej wartość statystyki testowej różni się od zera, tym jest mniejsze prawdopodobieństwo jej wystąpienia - jeśli H0 ma być prawdziwa. Zauważ też, że kształt tego rozkładu jest symetryczny. Ten rozkład jednakowo traktuje wartości ujemne, jak i dodatnie. Szansa na uzyskanie wartości większej od +1 jest taka sama, jak szansa na uzyskanie wartości niżej od -1.

Od czego zależy kształt tego rozkładu? Od czegoś, co nazywa się liczbą stopni swobody (ang. degrees of freedom). To taki parametr, który często jest uzależniony od liczby osób badanych. W przypadku testu t-Studenta wynosi on df = N - 1, a więc jest to liczba osób badanych pomniejszona o jeden. Gdy w badaniu weźmie udział N = 30 osób, to df = 30 - 1 = 29.

Rozkład t-Studenta ma ciekawą własność. Jego ogony są grubsze od ogonów rozkładu normalnego, przez co częściej obserwowane są wartości skrajne. Natomiast, gdy próba rośnie i rośnie, ogony coraz bardziej przypominają ogony rozkładu normalnego. Teoretycznie, gdybyśmy dysponowali nieskończoną próbą, rozkład t-Studenta byłby rozkładem normalnym.

DO CZEGO POTRZEBNY JEST ROZKŁAD STATYSTYKI TESTOWEJ? | Na podstawie rozkładu wartości statystyki testowej obliczana jest tzw. istotność statystyczna, czyli p-wartość (ang. p-value). P-wartość jest miarą zgodności danych z hipotezą zerową testu statystycznego, na podstawie którego ją obliczono (tu: testu t-Studenta dla grup zależnych). Z technicznego punktu widzenia, jest tym prawdopodobieństwem wystąpienia otrzymanej w teście wartości statystyki testowej - o ile manipulacja eksperymentalna nie przynosi żadnego skutku.

Sama p-wartość - sama istotność statystyczna - nie daje podstaw do twierdzenia, czy hipoteza badawcza została potwierdzona. Do tego trzeba wykonać nieco więcej kroków.

WIELKOŚĆ EFEKTU W TEŚCIE t-STUDENTA DLA GRUP ZALEŻNYCH

O WIELKOŚCI EFEKTU | Ponieważ istotność statystyczna wyniku nie jest synonimem dużej siły zależności między zmiennymi (tu oznaczałoby to, że manipulacja eksperymentalna powoduje dużą zmianę zmiennej zależnej między pomiarami), to badacz musi zwrócić się do innego narzędzia celem oceny wielkości swojego odkrycia. I tu przydatna okazuje się wielkość efektu (ang. effect size). Wielkość efektu to miara siły związku między zmiennymi i w przypadku porównań między dwoma średnimi (nasileniami) najczęściej wykorzystuje się wielkość efektu d-Cohena. d oznacza difference (ang. różnicaa Cohen to nazwisko autora tej miary.

JACOB COHEN | Cohen był amerykańskim psychologiem, o którym można byłoby powiedzieć, że lubił statystykę. Jako jeden z niewielu psychologów widział wady procedury testowania NHST i robił wszystko, aby ulepszyć analizy statystyczne prowadzone przez psychologów-badaczy. Rozwijał analizę mocy, aby badacze nie przegapiali efektów i upowszechniał wskaźniki siły zależności, aby nie opierali się jedynie na istotności statystycznej.

WIELKOŚĆ EFEKTU d-COHENA | Aby zbadać, czy średnie nasilenie zmiennej w pierwszym pomiarze naprawdę różni się od średniego nasilenia zmiennej w drugim pomiarze, wykorzystuje się wskaźnik zwany d Cohena. Nie jest on zwykłą różnicą między średnimi zmiennej zależnej a standaryzowaną. Standaryzacja oznacza podzielenie przez odchylenie standardowe. W ten sposób bierze się pod uwagę zarówno różnicę między średnimi, a także stopień rozproszenia wyników. Siła zależności zależy przecież nie tylko od tego, jak bardzo średnia spadła czy wzrosła, ale także od wyraźna jest to zmiana.

WŁASNOŚCI WIELKOŚCI EFEKTU d-COHENA
  • jest to pojedyncza liczba
  • przyjmuje wartości od minus nieskończoności do plus nieskończoności; czyli d może być dowolną liczbą
  • gdy jest równa zero, wówczas średnie arytmetyczne w dwóch pomiarach są sobie równe
  • aby dowiedzieć się, czy otrzymana w badaniu wielkość efektu jest mała czy duża, należy skorzystać z progów (ang. benchmarków), np. systemu progów Cohena.

ROZMIARÓWKA COHENA | Poniżej znajduje się system progów stworzony przez Cohena w 1988.

Według tej rozmiarówki, gdy wielkość efektu d-Cohena wynosi d = 0.25, to siła zależności jest mała i wyższa od niej jest np. d = -0.79

Pewnie spytasz, czy Cohenowi nic nie pomyliło się. Wygląda na to, że duże wielkości efektu, d > 0.8 oraz d < - 0.8, zajmują największy obszar osi liczb rzeczywistych. Otóż, nie, Cohen nie popełnił błędu. Nic mu się nie pomyliło. W psychologii wielkości efektu d nie są ogromne, zwykle lokują się blisko zera.

ROZMIARÓWKA LOVAKOVA i AGADULLINY | Od końca lat osiemdziesiątych minęło już trochę czasu i system Cohena zestarzał się, niekoniecznie elegancko. W wielu subdziedzinach psychologii powstały nowe, bardziej adekwatne do specyfiki badań w takiej poddziedzinie. W psychologii społecznej funkcjonuje nieco inny system benchmarków:

Zauważ, że przesunęły się granice. W tej rozmiarówce, d = 0.18 jest już małą wielkością efektu.

Błędy I i II rodzaju

LUTY 2025| LJK | ~2 000 słów| W trakcie poprawek

Ideę błędów I-go i II-go rodzaju zwykle przedstawia się w konkretny sposób. W procedurze NHST, badacz stawia hipotezę zerową, która - jak sama nazwa wskazuje - jest hipotezą o braku zależności. Oznacza ją H0 a następnie stawia drugą hipotezę, która treściowo jest do niej przeciwna, tzw. hipotezę alternatywną oznaczaną H1. Jedna hipoteza mówi, że coś istnieje, druga - że nie istnieje, zaś zadaniem badacza jest wybrać, która z nich jest tą prawdziwą - tą, która dobrze opisuje rzeczywistość. Wybierając źle, może pomylić się na dwa sposoby.


SPIS TREŚCI:

Błąd I i II-go rodzaju

Badacz popełni błąd, odrzucając prawdziwą hipotezę zerową H0 (i tym samym przyjmie fałszywą hipotezę alternatywną H1), albo przyjmując fałszywą hipotezę zerową (i tym samym odrzuci prawdziwą hipotezę alternatywną). Pierwszy błąd nazywany jest błędem I-go rodzaju. Drugi błąd jest nazywany błędem II-go rodzaju. Te błędy mają różne nazwy w różnych kontekstach. Wynik testu medycznego, w którym popełniono błąd I-go rodzaju, nazywa się fałszywie dodatnim (false positive), zaś wynik, w którym popełniono błąd II-go rodzaju, nazywa się fałszywie negatywnym (false negative). Z powodu odmiennych konsekwencji, jakie dla nauki niosą te błędy, błąd I-go rodzaju bywa kojarzony ze złudnymi artefaktami, a błąd II-go rodzaju - z przeoczeniami. Aby zrozumieć relację między błędami, najlepiej jest mieć wszystko czarne na białym - i na brązowym. Oto rysunek przedstawiający błędy w relacji do rzeczywistości.

BŁĄD I-GO RODZAJU, α - To błędne odrzucenie prawdziwej hipotezy zerowej H0. Choć hipoteza zerowa H0 jest prawdziwa, badacz odrzuca ją, popełniając przy tym ten błąd. Jeśli ją odrzuca, to musi wówczas przyjąć hipotezę alternatywną H1, a ta jest fałszywa. Skoro hipoteza zerowa jest tą o braku efektu (badanego zjawiska), to odrzucenie jej automatycznie oznacza przyjęcie, że zjawisko istnieje. W ten sposób można obawiać się, że do nauki będą wchodzić tzw. artefakty - nieistniejące efekty. Będziemy uznawać, że istnieją duchy, a tymczasem przecież one nie istnieją - prawda?

BŁĄD II-GO RODZAJU, β - To błędne odrzucenie prawdziwej hipotezy alternatywnej H1. Tym razem, to hipoteza alternatywna H1 jest prawdziwa, ale badacz odrzuca ją, popełniając przy tym ten typ błędu. Skoro hipoteza alternatywna mówi o istnieniu jakiegoś zjawiska, to odrzucenie jej automatycznie oznacza przyjęcie hipotezy o jego braku, nieistnieniu. W praktyce, oznacza uznanie, że dany lek jest nieskuteczny, terapia - nie działa, a ktoś nie spełnia jakichś wymogów. Dlatego błędy II-go rodzaju są nazywane błędami przeoczenia.

| Martwiąc się popełnieniem błędów I-go rodzaju, obrastamy w błędne przekonania, a potem mnóstwo energii zabiera nam usunięcie błędu II-go rodzaju.

Samo zrozumienie idei błędów I i II rodzaju raczej nie powinno sprawiać problemów. Kiedy czytasz te słowa,  już jesteś na tym etapie życia, że masz już za sobą popełnienie każdego z nich - i to wiele razy. Ile razy błędnie założyłeś, że podobasz się dziewczynie (błąd II-go rodzaju)? Ile razy okazało się, że odrzuciłaś fajnego faceta, bo wydawał się beznadziejny (błąd I-go rodzaju)? Ile razy myślałaś, że wystarczy jeszcze szamponu w butelce, a okazywało się, że nie (błąd I-go rodzaju). A ile razy myślałeś, że nie uda się, a jednak udawało się? W życiu codziennym wciąż popełniamy mniejsze i większe błędy obu rodzajów. Martwiąc się popełnieniem błędu I-go rodzaju, obrastamy w błędne przekonania na temat siebie, życia i drugiego człowieka, a potem mnóstwo czasu i energii zabiera nam usunięcie błędów II-go rodzaju.

Koszmar z błędami I i II rodzaju leży w zupełnie innym miejscu - w żonglerce słowami. Zobacz, napisałam:"błąd I-go rodzaju to błędne odrzucenie prawdziwej hipotezy zerowej", ale też "błędne przyjęcie fałszywej hipotezy alternatywnej". Oba zdania są prawdziwe i wyrażają ten sam stan rzeczy - różnią się tylko perspektywą. To pierwsze jest pisane z perspektywy wystawionej za drzwi hipotezy zerowej, a to drugie - z perspektywy konia trojańskiego, hipotezy alternatywnej.

Jeśli w poprzednim akapicie miałeś trudności ze zrozumieniem fraz, to wiedz, że nie wynika z tego, że błędy to skomplikowane pojęcia albo, że to Ty nie rozumiesz matematyki - to po prostu kwestia językowa. W zdaniach opisujących błędy występuje nieprzyjemny miks abstrakcyjnych pojęć ("błąd", nie można pokazać błędu na tej samej zasadzie jak można pokazać krzesło), powtórzeń ("błąd", "błędny"), które zestawiono ze słowami o przeciwnym znaczeniu ("prawdziwy", najpierw pojawia się coś "błędnego", a nieco dalej - coś "prawdziwego"). Na dodatek wszystko osadzono w zdaniu o konstrukcji biernej, gdzie nie ma aktywnego podmiotu ("błędne odrzucenie"). W takich wypadkach wystarczy sekunda nieuwagi - i już można się zgubić. Zawsze, gdy na wykładzie mam mówić o błędach I i II rodzaju, mój mózg pracuje na podwyższonych obrotach, bo wiem, że ja sama nie mogę się pomylić 😁.


Mężczyzna w ciąży i nieciężarna ciężarna

Wszystko, co powyżej zostało napisane, jest na wysokim poziomie ogólności, dlatego czas na przykład. Błędem I-go rodzaju jest stwierdzenie, że zjawisko istnieje, gdy ono nie występuje. Świetnym przykładem obrazowo ilustrującym ten rodzaj pomyłki, jest uznanie, że mężczyzna jest w ciąży. Badanie obwodu brzucha jest rozsądne - podczas ciąży brzuch rośnie. Niestety, czasami rośnie z innych powodów niż ciąża, a to badanie nie ma sensu w przypadku mężczyzn.

Błędem II-go rodzaju jest przeoczenie zjawiska, gdy ono naprawdę istnieje. W tym przypadku mamy kobietę w wyraźnej ciąży z badaniem USG ujawniającym płód. Tym razem lekarz myli się i mówi, że ona w ciąży nie jest. 


5% i 20% - akceptowalne poziomy błędów I i II rodzaju

Zwyczajowo przyjmuje się, że poziom błędu I-go rodzaju wynosi 0,05 lub: 5% zaś poziom błędu II-go rodzaju wynosi 0,20 lub: 20%.

Trudno powiedzieć, że wysokość tych progów wynika z jakiegoś twierdzenia matematycznego. Nie są też - jak stałe fizyczne - efektem serii pomiarów, które wskazałyby ich wysokość. Są po prostu... efektem umowy w środowisku naukowym - umowy zaproponowanej przez Ronalda Fishera oraz Jacoba Cohena. Ten pierwszy wskazał, że 5% próg błędów I-go rodzaju będzie dobrym poziomem pomyłek fałszywie pozytywnych. Ten drugi wskazał wartość 20%. I tak zostało.

Co nie oznacza, że tak musi być. Jak to bywa z umowami, można je zmieniać. Istnieją badania, w których testy mają inny niż pięć procent poziom błędów I-go rodzaju i inny niż dwadzieścia procent poziom błędów II-go rodzaju. Ten pierwszy może wynosić nawet 1%, jeśli chcemy być bardziej surowi. Może wynosi 10% - jeśli chcemy być bardziej liberalni. O testach liberatlnych i konserwatywnych porozmawiamy za chwilę.


Co znaczy, że błąd jakiegoś rodzaju wynosi 5% lub 20%?

Co to znaczy, że błąd I-go rodzaju wynosi 5%? Chciałoby się powiedzieć, że to w ilu procentach mylimy się, jeśli zależność nie istnieje. Innymi słowy, gdy hipoteza zerowa jest prawdziwa, mamy pięcioprocentową szansę pomylić się. Uważaj tutaj - poprzednie zdanie jest tak skonstruowane, aby uśpić Twoją czujność. Kluczem do zrozumienia błędu I-go rodzaju jest słowo "szansa". Co to w ogóle znaczy: “szansa” lub "prawdopodobieństwo"?

| Kluczem do zrozumienia błędu I-go rodzaju jest słowo "szansa".

Błąd I i II-go rodzaju to idee pochodzące z jednej ze szkół statystyki. Szkół? – pomyślisz. Tak, szkół w liczbie mnogiej. Wbrew przekonaniom, statystyce daleko od ujednoliconej dziedziny wiedzy. Wciąż ścierają się w niej różne idee. Proces testowania hipotez, ten z istotnością statystyczną, to efekt połączenia dwóch szkół, a tylko w jednej z nich pojawiają się błędy I i II rodzaju. Koncepty noszą w sobie sposób myślenia twórcy. W przypadku błędów jest to tzw. częstościowa interpretacja prawdopodobieństwa. Aby naprawdę zrozumieć, co znaczy pięcioprocentowa szansa popełnienia błędu I-go rodzaju - lub dwudziestoprocentowa błędu II-go rodzaju - w trakcie weryfikacji hipotez statystycznych, należy zgłębić coś, co stanowi jej sedno.


Częstościowa interpretacja prawdopodobieństwa w służbie błędów I i II rodzaju

Wyobraź sobie, że rzucasz złotówką. Na jednej stronie ma orła, na drugiej wybito napis "1 złoty". W języku angielskim o monecie, która jest dobrze wyważona, mówi się, że jest fair - uczciwa. Szansa otrzymania orła podczas rzucania uczciwą monetą jest taka sama jak reszki, czyli ½. Co praktycznie oznacza ta liczba ½ ? Czy to, że otrzymamy pół orła i pół reszki? Że moneta spadnie na brzeg? Nie. Ta jedna druga oznacza, że gdybyśmy długo rzucali tą monetą, stosunek liczby otrzymanych orłów do liczby rzutów zbliżałby się ku ½. Taka jest częstościowa interpretacja prawdopodobieństwa - opowiada ona o tym, co zdarzy się het, daleko za horyzontem powtarzanych zdarzeń. Powtarzanym doświadczeniem losowym może być rzucanie monetą albo kostką. Równie dobrze to też może być badanie z zakresu psychologii, w którym postawiono dwie hipotezy.


Co znaczy, że błąd I rodzaju wynosi 5%?

Pięcioprocentowy błąd I-go rodzaju oznacza, że gdybyśmy prowadzili to samo badanie wiele razy a zjawisko nie istniałoby, to po jakimś czasie zauważylibyśmy, że istnieje pewien odsetek replikacji, które mimo wszystko pokazują pozytywny wynik - pokazują, że zjawisko istnieje. Odsetek takich wyników testu wynosiłby pięć procent.


Co znaczy, że błąd II rodzaju wynosi 20%?

W podobny sposób należy myśleć o błędzie II-go rodzaju. Dwudziestoprocentowy błąd II-go rodzaju oznacza, że gdybyśmy prowadzili to samo badanie wiele razy, a badane zjawisko naprawdę istniałoby, to zauważylibyśmy, że są takie wyniki testu, które mylą się, pokazując, że zjawisko nie istnieje. Odsetek takich replikacji wynosiłby właśnie dwadzieścia procent.


Konsekwencje częstościowej interpretacji dla testu

Na szczęście, nie oznacza to, że musisz prowadzić tak wiele badań, aby wreszcie zobaczyć, że w pięciu procentach mylisz się. Badacz zwykle nie dysponuje więcej niż kilkoma replikacjami swojego eksperymentu. Student najczęściej ma jedno badanie - to do pracy magisterskiej. Czy to oznacza, że nie może określić błędu I-go rodzaju dla wybranego testu statystycznego? Nie. Błąd I i II rodzaju to teoretyczne koncepty. Staramy się tak dobrać parametry testu (liczebność próby, wielkość szukanej zależności), aby teoretycznie te błędy pozostawały na wybranych poziomach. "Teoretycznie" znaczy: "w odpowiednio długiej perspektywie". Gdybyśmy tę długą perspektywę oglądali, wykonując ponownie i ponownie te badania.

| Teoretycznie znaczy w odpowiednio długiej perspektywie.

To wszystko oznacza, że w jednym badaniu nie wiadomo, czy poprawnie przyjmujesz czy odrzucasz hipotezę zerową. Tego nie wiesz - ufasz, że gdyby je prowadzono i prowadzono, to jedynie w 5% błędnie odrzucano by prawdziwą hipotezę zerową. I w 20% błędnie odrzucano by prawdziwą hipotezę alternatywną.

| Nie można umrzeć w 5% a żyć w 95%.

Czy to w ogóle ma sens? - pomyślisz. Zauważ, że to rozumowanie w zupełnie innym kontekście nabiera sensu a dzieje się tak, gdy rozmawiamy o szansach na śmiertelne powikłania przy pewnej operacji. Co oznacza, że operowany pacjent ma 5% szans na zejście? Konkretny pacjent przeżyje albo nie przeżyje operacji - nie można umrzeć w 5% a żyć w 95%. O tych pięciu procentach myśli się zbiorczo - wśród operowanych pacjentów odsetek śmiertelności wynosi 5%. Co dwudziesty pacjent nie przeżyje, ale nie wiadomo na kogo padnie. Jak widzisz, częstościowy sposób rozumienia szans masz już w głowie. Wystarczy go tylko przenieść na grunt testów statystycznych.


Współzależność błędów I i II-go rodzaju

Życie uczy, że dobrze jest nie popełniać błędów. Dobrze jest nie szukać kluczy, tam gdzie ich nie ma. Dobrze jest nie szukać czegoś, co nie istnieje. Tak samo moglibyśmy zechcieć zminimalizować błąd I-go rodzaju. Najlepiej - wyzerować. Ale jeśli zaprojektujemy test, którego poziom błędu I rodzaju α był równy 0, to ceną, jaką za to zapłacimy jest maksymalizacja błędu II-go rodzaju. Jak to się dzieje?


Czy można wyzerować błędy?

KONSEKWENCJE MINIMALIZACJI BŁĘDU I-GO RODZAJU- Aby uniknąć błędu I-go rodzaju, chcielibyśmy przyjmować te hipotezy zerowe, które są prawdziwe. Projektujemy zatem test, który przyjmuje każdą hipotezę zerową. Pamiętaj, że cały czas pozostajemy w statystyce częstościowej, frekwentystycznej. Wyobraźmy sobie więc całą serię badań, a w każdym z nich przyjmujemy hipotezę zerową.

W zasadzie moglibyśmy nawet badań nie robić, bo i tak nie odrzucimy żadnej hipotezy zerowej. Nawet tej fałszywej. To z kolei prowadzi do tego, że jeśli w rzeczywistości jest jakiś efekt, jakaś różnica między grupami, czy korelacja, to i tak nie uznamy jej istnienia. A więc popełnimy błąd II-go rodzaju. W tej serii badań cały czas będziemy popełniać błąd drugiego rodzaju. To oznacza, że popełnimy 100% błędów drugiego rodzaju, chcąc wyzerować błędy pierwszego.

KONSEKWENCJE MINIMALIZACJI BŁĘDU II-GO RODZAJU - Wykorzystajmy jeszcze raz przykład prawniczy. W przykładzie prawniczym błąd II-go rodzaju oznacza błędne odrzucenie prawdziwej hipotezy alternatywnej (a brzmi ona tak: dana osoba jest przestępcą) i przyjęcie fałszywej hipotezy zerowej (dana osoba jest niewinna). Chcemy, aby było idealnie i perfekcyjnie, czyli w żadnym ze 100 przypadków nie popełnić tego błędu. Zatem w obawie przed popełnieniem błędu II-go rodzaju zwanego β profilaktycznie i przezornie uznajemy, że wszyscy oskarżeni są winni. I kropka. Co się wówczas dzieje? Przestępcy słusznie siedzą za kratkami, ale osoby niewinne również wędrują do więzienia. Błąd II-go rodzaju jest równy zero, ale zmaksymalizowaliśmy błąd I-go rodzaju.

A tak naprawdę to, chcielibyśmy zminimalizować błąd I-go i błąd II-go rodzaju. Ale one są ze sobą powiązane. Wyzerowanie błędu II-go rodzaju pociągnie zmaksymalizowanie błędu I-go rodzaju. Jaki byłby odpowiedni kompromis między poziom błędu I-go a II-go rodzaju?

Test konserwatywny i test liberalny

Chcemy, żeby poziom popełniania błędów I-go rodzaju był równy 5%. Ale czy to przypadkiem nie jest tylko myślenie życzeniowe czy zwykłe chciejstwo? Może są testy, które odrzucają więcej hipotez zerowych i testy, które odrzucają mniej? Są. Nawet mamy dla nich nazwy 😁
Test, który ma tendencję do nieodrzucania hipotezy zerowej (częściej uważa, że hipoteza zerowa jest prawdziwa), to test, którego rzeczywisty poziom błędu I-go rodzaju nie przewyższa nominalnego, najczęściej 5-procentowego progu, jest nazywany testem konserwatywnym.

Dlaczego piszę:"rzeczywisty"? Bo zawsze można w laboratorium sprawdzić, czy test naprawdę odrzuca 5%, czy może mniej. To laboratorium to są symulacje i dzięki temu wiemy, że niektóre testy mimo, że na etapie ich projektowania chcieliśmy aby myliły się dokładnie 5%, to jednak nie osiągają tego pułapu (to tylko na pozór dobrze). Pamiętaj, jeśli test jest konserwatywny, to popełnia mniej błędów I-go rodzaju, a kosztem tego jest zwiększenie błędów II-go rodzaju.

TEST KONSERWATYWNY - Wyobraź sobie wielokrotne wykonywanie tego samego badania, a więc tego samego testu. Jak sama nazwa wskazuje, hipotezy zerowe zwykle mówią o braku efektu. Za to hipotezy alternatywne - o tym, że coś istnieje, co czyni je bardziej postępowymi. Z tej perspektywy taki test, który nie chce być postępowym a pragnie zachować status quo jest testem konserwatywnym.

Jeśli badacz chce popełniać mało błędów I-go rodzaju to oznacza, że chce rzadko odrzucać prawdziwe hipotezy zerowe. Aby rzadko odrzucać prawdziwe hipotezy zerowe, trzeba rzadko odrzucać hipotezy zerowe. Żeby rzadko odrzucać atrakcyjnych partnerów, trzeba rzadko odrzucać partnerów w ogóle. Ta strategia ma swój koszt - skoro rzadko odrzucać, to znaczy częściej przyjmować hipotezy zerowe. A to oznacza, że może zdarzać się przyjmowanie fałszywych hipotez zerowych. Przyjęcie fałszywej hipotezy zerowej to odrzucenie prawdziwej hipotezy alternatywnej, a hipotezy alternatywne mówią o istnieniu jakiegoś efektu. Skoro rzadko je przyjmujemy, to jesteśmy dość konserwatywni: częściej twierdzić, że nie ma efektu niż, że jakiś jest.

Hipotezy zerowe mówią zwykle o braku istnienia jakiegoś efektu, a konserwatywny jest słowem o etymologii łacińskiej (conservare znaczy przechowywać, zachowywać) i ma znaczenie zachowawczy (‘lepiej nic nie zmieniać’), więc test, który ma tendencję do nieodrzucania hipotezy o zerowym efekcie, jest testem konserwatywnym. Taki test myśli sobi: na wszelki wypadek niczego nie wynajdę, co bym nie musiał się martwić, że społeczeństwo się zmieni.

Taki test, który w wielokrotnym powtórzeniu tego samego badania ma obniżony poziom błędu I-go rodzaju ma jednocześnie podwyższony poziom błędu II-go rodzaju.

| Test konserwatywny jest jak człowiek, który nikomu nie wybacza. Test liberalny - jak ten, który wybacza wszystko.

TEST LIBERALNY - Test liberalny to test, który nie jest testem konserwatywnym. Niektórzy nazywają je antykonserwatywnymi. Jeśli czytasz te słowa po przeczytaniu poprzedniego akapitu, najbliższa treść powinna być intuicyjna - a przynajmniej bardziej intuicyjna. Jeśli test jest testem liberalnym, to znaczy, że nie chce zachowywać ustalonego status quo. Wobec tego, będzie częściej odrzucał hipotezę zerową i - zarazem - częściej przyjmował hipotezę alternatywną. To oznacza, że spadnie mu błąd II-go rodzaju, ale jednocześnie wzrośnie błąd I-go rodzaju. Test, który ma rzeczywisty poziom alfa wyższy niż 5%, czyli mimo tego, że teoretycznie powinien popełniać nie więcej niż 5% pomyłek w rzeczywistości popełnia ich więcej.⬛️



Więcej informacji…

➡️Błąd II-rodzaju jest związany z analizą mocy - techniką statystyczną, która służy do wyznaczania potrzebnej wielkości próby. Jeśli błąd II-go rodzaju wynosi 20%, to moc testu wynosi 80%. Więcej tu: KLIK
➡️ Częstościowa interpretacja działa również w przypadku 95% przedziału ufności, który oznaczał, że gdybyśmy przeprowadzili doświadczenie wiele, wiele razy i za każdym razem obliczali przedział ufności, to 95% z nich zawierałoby prawdziwą wartość parametru. Jeden konkretny przedział ufności zawiera, albo nie zawiera - tego nie wiadomo. Podobnie tutaj: kontrolujesz błędy I-go i II-go rodzaju w teoretycznym ciągu replikacji eksperymentu, ale w konkretnym przypadku nie wiesz, jak jest.
➡️ Błąd I-go rodzaju nie jest istotnością statystyczną lub p-wartością, wbrew temu, co niektórzy piszą, a brzmi to mniej więcej tak:"Istotność statystyczna to prawdopodobieństwo popełnienia błędu pierwszego rodzaju, jeśli hipoteza zerowa jest prawdziwa." Dlaczego to problem? Momenty czasowe nie zgadzają się. Błąd I-go rodzaju jest ustalany przed przeprowadzeniem badania. Wynosi 5%. Istotność statystyczna (p-wartość) to coś, co obliczane jest po jego przeprowadzeniu.