Pokazywanie postów oznaczonych etykietą freq. Pokaż wszystkie posty
Pokazywanie postów oznaczonych etykietą freq. Pokaż wszystkie posty

Diagnostyka normalności: Liczby i rysunki

Rozkład normalny to podstawowy rozkład w statystyce. Mówimy, że taka-to-a-taka cecha ma rozkład normalny. Że założenia testów różnych testów statystycznych: testu t-Studenta oraz analizy wariancji ANOVA wymagają rozkładu normalnego. Że model jest dobry, gdy rozkład błędów jest normalny. Skąd jednak badacz ma wiedzieć, czy zebrane przez niego liczbowe wartości zmiennej układają się zgodnie z krzywą Gaussa? W tym poście piszę, jak należy sprawdzać, czy cecha w zebranej przez Ciebie próbie może mieć rozkład zbliżony do normalnego. Jeśli chcesz przejść od razu do narzędzi, kliknij tutaj: KLIK.

SPIS TREŚCI:

WPROWADZENIE — W każdej dziedzinie jest zbiór pojęć rozpoznawanych poza nią. W psychologii jest to np. procesy poznawcze. W statystyce takim pojęciem funkcjonującym w zbiorowej świadomości jest rozkład normalny łatwo zapamiętywalny ze względu na charakterystyczny, dzwonowaty kształt. Wiele lat temu uważano, że rozkład normalny stanowił dobry model zjawisk społecznych. Obecnie odchodzi się od tego myślenia, ale nie zmienia to jego popularności, zwłaszcza że analizy, jakie wykorzystują badacze, opierają się na tym rozkładzie. Więcej informacji na temat rozkładu normalnego znajdziesz w poście  KLIK. Tutaj ograniczymy się do tylko części potrzebnej do zrozumienia, jak działają narzędzia diagnostyczne służące do - jak sama wskazuje - diagnozy tego, czy badana cecha ma rozkład normalny. Takie zadanie często stoi przed badaczem i najprawdopodobniej szukałby on jakiegoś testu statystycznego. Wiadmo, jak statystyka, to testy. Badacze mają nawyk testowania wszystkiego w dobrym i złym tego słowa znaczeniu, więc nic dziwnego, że jako pierwsze przychodzą do głowy testy statystyczne. Istnieją jednak inne nie-testowe metody oceny normalności rozkładu — i o tym jest ten post.

DIAGNOSTYKA NORMALNOŚCI A TYP POMIARU — Narzędzia służące do oceny normalności rozkładu stosujemy tylko i wyłącznie wtedy, gdy wiemy, że mierzona przez nas zmienna czy badana cecha ma najwyższy w skali Stevensa, ilościowy typ pomiaru, np. jest to czas reakcji, wiek, długość, szerokość. Często przyjmuje się, że wyniki ogólne w kwestionariuszach również charakteryzują się tym typem pomiaru. Chodzi o to, że narzędzia, jakie zaraz poznasz, działają dla tych zmiennych, których wartości reprezentują matematycznie rozumiane liczby. Liczby, które można dodawać, mnożyć, dzielić, a nie "liczby" ujęte w cudzysłów, bardziej znaki graficzne, jak dla zmiennej nominalnej albo porządek jak dla zmiennej porządkowej. Rozkład normalny mogą posiadać jedynie zmienne ilościowe. Nie badamy normalności dla płci (kobieta, mężczyzna, niebinarna) czy wykształcenia (mierzonego kategoriami: podstawowe, średnie, wyższe)

CZY ISTNIEJE JEDEN ROZKŁAD NORMALNY? Patrząc na powyższy rysunek, widzimy tylko jeden z możliwych rozkładów normalnych. Taki, który ma parametry 0 i 1. Kreskowaną linią zaznaczono szczyt tej krzywej, który jednocześnie jest średnią. Ponieważ zamiast zera i jedynki może stać tutaj absolutnie dowolna liczba rzeczywista, to rozkładów, o których można powiedzieć, że są normalne, jest nieskończenie wiele. Dlaczego jest ich nieskończenie wiele, a jakby jeden? Wszystkie łączy ten sam wzór ogólny. Posiadając wspólną matematyczną formułę, tworzą jedną rodzinę. Jedyne, co się w niej zmienia, to drobiazgi zwane parametrami - to co na rysunku jest zerem i jedynką. Ogólny wzór pozwala narysować krzywą Gaussa przypominającą dzwon (choć czasem trudno go zobaczyć).

Na podobnej zasadzie działa funkcja liniowa np. y = x + 2 lub y = -x - 1.



W każdym wzorze zamiast jedynek i dwójek mogłaby stać dowolna inna liczba, a i tak nadal byłaby to funkcja liniowa z wykresem w postaci linii prostej. Wszystkie spełniają tzw. ogólny wzór postaci: y = a*x+b. Podobnie, rozkłady normalne mają jeden wspólny wzór, choć nieco bardziej skomplikowany niż ten na funkcję liniową. Widzisz go w górnym lewym rogu poniższej ilustracji:


Rozkład, którego rysunek widzisz, jest jednym z wielu rozkładów normalnych, ale jest to charakterystyczny członek tej rodziny - tzw. rozkład standardowy normalny N(0,1), gdzie zero to pierwszy parametr zwany średnią, a jeden to drugi parametr zwany odchyleniem standardowym.

Wspólny wzór powoduje, że mimo różnic w wyglądzie, członkowie rodziny rozkładów normalnych dzielą podobne własności i to właśnie wykorzystują narzędzia diagnostyczne. Rozsądne byłoby pomyśleć tak: jeśli oczekujemy, aby badana cecha (lub szerzej - zmienna) miała rozkład normalny, to powinna się w rozsądnym stopniu wykazywać tymi właściwościami.

Na przykład, jeśli chcesz sprawdzić, czy masz do czynienia z psem, to sprawdzasz, czy dany obiekt szczeka, ma ogon i chodzi na czterech łapach (lub w odwrotnej kolejności). Wszystkie nieuszkodzone psy mają te właściwości.

NARZĘDZIA DIAGNOSTYCZNE — Narzędzia diagnostyczne dzielą się na liczbowe i na graficzne. Te pierwsze po prostu liczby, a profesjonalnie rzecz mówiąc: statystyki opisowe. Te drugie to wykresy. O ile wskazanie teoretycznych wartości statystyk liczbowych nie jest trudne, problemem staje się to, jak pokazać działanie empirycznych narzędzi na teoretycznym tworze, jakim jest rozkład normalny. Poradzimy sobie, stosując mały trik. Skoro przyjmuje się, że rozkład teoretyczny jakieś cechy to rozkład w całej populacji, to weźmiemy przeogromną próbę i na takiej zbadamy zachowanie narzędzi. W ten sposób będziemy mogli zbliżyć się do teoretycznego rozkładu normalnego i jednocześnie poznać narzędzia diagnostyczne.
Oto lista narzędzi wraz z omówieniem ich zachowania wśród rozkładów teoretycznych (niżej jest lista z omówieniem zachowania w próbie)

  • STATYSTYKI OPISOWE
    • skośność - miara asymetrii rozkładu. Rozkład normalny ma zerową skośność. Więcej na ten temat znajdziesz w poście: KLIK
    • kurtoza - miara koncentracji i obecności obserwacji odstających. Rozkład normalny ma zerową kurtozę. Więcej na ten temat znajdziesz w poście: KLIK
  • WYKRESY
    • histogram — wykres pokazujący ogólny kształt rozkładu poprzez zestaw prostokątów, których szerokość to przedział liczbowy, a wysokość to liczba obserwacji, które znalazły się w tym przedziale. Więcej o histogramie: KLIK. Mimo tego, że rozkładu teoretycznego nie przedstawia się za pomocą histogramu, a za pomocą gładkiej linii reprezentującą gęstość lub kropek reprezentujących funkcję prawdopodobieństwa (mówimy o teoretycznych sprawach), to przeogromna próba będzie substytutem populacji. Powinna się wpasowywać w krzywą Gaussa.
    • wykres skrzynkowy (boksplot) - wykres, pokazujący jeden prostokąt z wąsami. Rozkład normalny tworzy wykres postaci:
      Jest on symetryczny względem czarnej poziomej linii reprezentującej medianę. Wąsy są w równej odległości od dolnej i górnej krawędzi skrzynki. Rozkład normalny posiada też obserwacje odstające (outliery) - a to ze względu na regułę 3 sigma. Więcej o boxplocie: KLIK
    • wykres kwantylowy wykres przestawiający punkty.
      Na osiach znajdują się kwantyle rozkładu badanej cechy oraz kwantyle rozkładu normalnego. Więcej o wykresie kwantylowym: KLIK

ZACHOWANIE NARZĘDZI W PRÓBIE — Przeanalizujemy teraz każde z narzędzi i omówimy jego zachowanie w próbie. Przechodząc z teorii do empirii, należy pamiętać, że są dwie rzeczy, które mają wpływ na to, że najczęściej jedno z drugim nie zgadza się i powoduje, że nie możemy oczekiwać tych samych wyników w próbie.

LOSOWA ZMIENNOŚĆ — Wiemy, że rozkład normalny ma zerową skośność i zerową kurtozę, a wykresy mają określony wygląd. Czy w związku z tym możemy oczekiwać, że w próbie będzie dokładnie tak samo? Nie. Te wymagania są zbyt idealne, aby pojawiły się w naszym świecie empirycznym. Rozkład normalny jest przecież rozkładem teoretycznym – zerowa skośność i zerowa kurtoza nie wynika z czyjegoś doświadczenia, a z precyzyjnych matematycznych obliczeń. Trzeba jednak pamiętać, że jest to wynik teoretyczny. Oczekiwania, co do tego, co pojawi się w zebranej przez badacza próbie, muszą być łagodniejsze.

Najłatwiej wytłumaczyć to sobie w następujący sposób: gdybyśmy zgromadzili wszystkie osoby (tj. przebadali całą populację) i wówczas policzyli skośność i kurtozę, to powinna ona wynosić zero - zero jest populacji. Ale próba jest tylko wycinkiem populacji i mogą trafić się różne osoby (czyli wchodzi tu losowość wyników), więc trudno liczyć na to, że skośność i kurtoza będzie równa dokładnie zero. Dlatego musimy wykazać się pewną elastycznością w oczekiwaniu, że wartości statystyk opisowych w próbie będą zero. Innymi słowy, musimy zaakceptować pewne niezerowe (choć bliskie zeru) wartości a nie żądać dokładnych zer.

ZNACZENIE WIELKOŚCI PRÓBY — Trudno jednak nie wspomnieć o wadzie tych reguł kciuka - są one sztywne, czyli niezależne od liczby przebadanych osób. A przecież nawet na chłopski rozum, nawet gdy badana zmienna ma rozkład normalny (np. inteligencja), to wzrost liczby badanych powinien powodować zbliżanie się skośności i kurtozy do tej idealnej, zerowej wartości. Podobnie jest z wykresami. To, co uchodzi w małej próbie, nie powinno przytrafi się w dużej.

REGUŁY KCIUKA Z pomocą przychodzą wskazówki, które mówią, jaki przedział niezerowych wartości skośności i kurtozy można dopuścić jako przedział takich wartości, które jeszcze nie powodują uznania, że badany rozkład nie jest rozkładem normalnym. Nazywam je regułami kciuka - powinny sprawdzać się w większości typowych sytuacji, ale nie mają statusu twierdzenia matematycznego. Dla ścisłości, będziemy mówić o próbkowej skośności (teoretyczna wynosi 0) i próbkowej kurtozie (teoretyczna wynosi 0) oraz o empirycznych wykresach. Wszystko dlatego, aby podkreślić, że liczymy statystyki i tworzymy wykresu z udziałem próby, a nie teoretycznych wartości.

NARZĘDZIA DIAGNOSTYCZNE

  • STATYSTYKI OPISOWE
    • skośność — Przedział niezerowych, lecz wciąż akceptowalnych wartości próbkowej skośności to [–1, 1].


    • kurtoza — Przedział niezerowych, lecz wciąż akceptowalnych wartości próbkowej kurtozy jest nieco szerszy niż dla skośności i wynosi [–2,2].


    Jeśli zobaczysz skośność badanej zmiennej w przedziale między minus 1 a 1, to nie odrzucaj od razu normalności rozkładu. Podobnie, jeśli zobaczysz kurtozę badanej zmiennej w przedziale od minus 2 do 2.  To, że skośność wynosi np. 0,56 a nie 0 jeszcze nie oznacza, że rozkład nie może być normalny. Pamiętaj jednak, że ta sama wartość skośności i kurtozy różnie wygląda na tle małej lub dużej próby. Przykładowo, podczas gdy skośność równa 2,01 w próbie liczącej n = 30 osób jest akceptowalna, to w dużej próbie liczącej n = 30 000 osób jest podejrzanie dużym wynikiem.

  • WYKRESY
    • wykres skrzynkowy (boksplot) — wykres skrzynkowy dla małej próby, N = 10, dla umiarkowanej próby, N = 30, oraz dla dużej próby, N = 1000. Wykres dla dziesięciu osób zupełnie nie przypomina wykresu skrzynkowej rozkładu normalnego, a przecież wiemy, że te dziesięć wartości pochodzi z rozkładu normalnego. Przyczyną jest losowa zmienność, która zaciera charakterystyczną strukturę tego wykresu. Dla trzydziestu wartości boksplot jest przynajmniej symetryczny, a najpiękniejszy z nich jest wówczas, gdy zbierzemy wartości od tysiąca osób.
    • histogram — tutaj również pokazane są histogramy dla trzech typów prób: o bardzo małych liczebnościach, N = 10, dla umiarkowanych prób, N = 30 oraz dla prób o dużej liczebności N = 1000. Histogram rozkładu cechy, nawet jeśli wiadomo, że w populacji jest ona gaussowska, w małej próbie jest w ogólnie podobny do dzwonowej krzywej Gaussa. Cechy charakterystyczne histogramu są widoczne dopiero w dużych próbach.
    • wykres kwantylowy — aby badana zmienna posiadała rozkład normalny, punkty powinny układać się na prostej. Tak dzieje się na trzecim wykresie, ale jednocześnie jest to wykres próby bardzo licznej o N = 1000 obserwacji. W mniejszym próbach musimy zrezygnować z takiego oczekiwania.

KONIECZNOŚĆ STOSOWANIA TESTÓW NORMALNOŚCI? — Narzędzia palpacyjne, takie jak powyżej, to inna oprócz formalnych testów statystycznych metoda badania normalności rozkładu zmiennej. Niestety, badacze są przyzwyczajeni do tego, że testy statystyczne to jedyna poprawna opcja. Tymczasem to po pierwsze nieprawda, jak widać na załączonym obrazku, a po drugie - testy statsytyczne same w sobie obarczone są problemami. Zwróćmy uwagę, że nigdzie nie kontrolujemy liczebności próby, posługując się mglistymi stwierdzeniami, że takie-to-a-taki test jest mocniejszy niż inny. Kierowanie się tylko i wyłącznie istotnością statystyczną testu normalności może sprawić, że badacz popełni błąd. Najlepsze rozwiązanie to łączyć obie metody - palpacyjną i formalną.

DIY - czyli zrób Diagnostykę normalności w SPSS 28. Masz niższą wersję? Nie martw się. Różnice w krokach między tą wersją SPSS a pozostałymi są chyba - nomen omen - nieistotne.

1. Zidentyfikuj zmienną, której normalność chcesz badać. Tutaj ta zmienna nazywa się banalnie - po prostu: Cecha. Następnie wybierz Analiza -> Opis statystyczny -> Eksploracja.

2. Przesuń badaną zmienną z lewego, białego okna na prawe, górne o nazwie Zmienne zależne. Dzięki temu SPSS będzie wiedzieć, którą zmienną diagnozujesz.

Klikając przycisk Statystyki, nic szczególnego nie ma do wyboru. SPSS wie, co ma wybrać. Więc pozostaw zaznaczoną opcję Statystyki opisowe i wciśnij Dalej.

4. Kliknij na drugi od góry przycisk Wykresy. Pojawi się nowe okienko. W panelu Wykresy skrzynkowe pozostaw domyślnie zaznaczoną opcję Poziomy czynnika razem. W panelu Opis odznacz Łodyga-i-liście (tym wykresem nie będziemy zajmować się) i zaznacz Histogram. Następnie, zaznacz okienko Wykresy normalności z testami. Mimo tego, że w tym poście nie zajmujemy się testami normalności, to aby uzyskać wykres kwantylowy (qqplot), musimy zaznaczyć wszystko.

Naciśnij Dalej.

5. Gdy wrócisz do głównego okienka, wybierz OK. To już wszystkie polecenia, jakie są nam potrzebne.

Test t-Studenta dla dwóch grup zależnych (ang. two-sample t-test)

LISTOPAD 2023 | LJK | ~2300 słów

Test t-Studenta dla grup zależnych (ang. t-Student's test for paired/dependent/matched data) to test wykorzystywany do porównania średnich nasileń zmiennej ilościowej w przypadku, gdy zebrane obserwacji można połączyć w pary. Wyniki w parze dotyczą tej samej zmiennej ilościowej.



SPIS TREŚCI:

Wprowadzenie

PORÓWNANIA MIĘDZY DWIEMA ŚREDNIMI nasileniami pewnej zmiennej (np. wzrostu, samooceny, introwersji, empatii, narcyzmu) to popularny schemat badawczy, w którym dane pochodzą z porównania dwóch różnych grup (np. kobiety vs. mężczyźni) albo z porównania tej samej grupy badanych przed i po działaniu czynnika eksperymentalnego (np. przed podaniem środka pobudzającego i po; przed zadziałaniem bodźca i po nim). Bardzo często takie dane analizuje się za pomocą testu t-Studenta. W statystyce istnieją dwie wersje tego testu - dla grup niezależnych i dla zależnych. Wersja, jaką wybierzemy, zależy od tego, jak zebraliśmy dane - czy wyniki pomiarów pochodzą od jednostek badanych jeden raz, czy może dwukrotnie.

Gdy badana cecha jest mierzona w obrębie dwóch różnych, wykluczających się kategorii np.:
kobieta i mężczyzna (nie można być i kobietą, i mężczyzną na raz), dane są nazywane niezależnymi i do ich analizy służy test t-Studenta dla grup niezależnych KLIK. Z kolei, gdy ta sama grupa osób badanych przechodzi przez pierwszy i drugi warunek badania, np. pretest i posttest, wówczas dane nazywa się zależnymi i do ich analizy służy test t-Studenta dla grup zależnych. W tym poście zajmiemy się tym drugim przypadkiem.

To oczywiście bardzo duże uproszczenie pojęcia. Zależność obserwacji oraz jej brak, czyli niezależność jest czymś więcej niż tylko krotnością brania udziału w badaniu przez jednostki badanie.

TEST t-STUDENTA dla zależnych grup (albo par obserwacji) znajduje zastosowanie w prostych eksperymentach: najpierw mierzymy wyjściowy poziom interesującej nas zmiennej,  potem osoby badane poddajemy działaniu eksperymentalnemu (np. obejrzeniu filmu mającego wywołać określone emocje, spożyciu jakiś specyfiku, wyobrażeniu sobie czegoś). Następnie znowu mierzymy poziom tej samej zmiennej, na którą to działanie eksperymentalne miało mieć wpływ. Tym samym chcemy sprawdzić, czy eksperyment coś zmienił, czyli to działanie terapeutyczne wprowadziło coś nowego. Do analiz wyników, jakie powstają dzięki temu działaniu, służy właśnie ten test.


Hipoteza zerowa H0

Hipoteza zerowa H0 w teście t-Studenta dla prób zależnych mówi o równości średnich nasileń zmiennej zależnej dokonanych między dwoma pomiarami. Na przykład średni poziom stresu (mierzony stężeniem kortyzolu we krwi) przed i po zadziałaniu bodźca. Jej symboliczny zapis jest następujący. Grecka litera μ1 oznacza średnie nasilenie badanej cechy w pierwszym pomiarze, a μ2 oznacza średnie nasilenie badanej cechy w drugim pomiarze:

H0: μ1 = μ2

Zauważ, że treść tej hipotezy zerowej w teście t-Studenta dla prób zależnych przypomina hipotezę zerową testu t-Studenta dla prób niezależnych - tam również można było ją zapisać w sposób identyczny z powyższym. Różnica polega na tym, że teraz indeksy oznaczają co innego. Poprzednio, indeks dolny oznaczał numer poziomu czynnika, np. 1 = kobiety, 2 = mężczyźni. Tym razem jest to kolejność pomiaru. 1 oznacza pierwszy pomiar, a 2 - drugi pomiar. Pamiętaj, w teście t-Studenta dla grup zależnych to jest ta sama grupa osób badanych, więc dwukrotnie mierzymy średni poziom tej samej zmiennej między pomiarami.

JAK INTERPRETOWAĆ TREŚĆ H0? | Ogólnie rzecz biorąc, w procedurze klasycznego testowania istotności statystycznej hipotezy zerowej H0, hipoteza zerowa mówi o braku efektu. Chcąc przykroić ją na potrzeby dwukrotnego pomiaru tej samej zmiennej ilościowej, ów brak efektu możemy rozumieć jako niepowodzenie w manipulacji eksperymentalnej. Innymi słowy, manipulacja nie przyniosła pożądanego efektu: wyniki zmiennej zależnej ani średnio nie wzrosły, ani średnio nie spadły, wciąż pozostając mniej więcej na tym samym poziomie.

BŁĘDY W ZAPISIE H0 | W sformułowaniu tej hipotezy wcale nie chodzi o równość dwóch średnich arytmetycznych w dwóch zebranych próbach - dotyczy ona populacji, dlatego widzisz greckie znaczki sygnalizujące nasilenie cechy na wyższym poziomie niż próba.

Pamiętaj, że równość średnich wyrażona w hipotezie zerowej nigdy nie dotyczy równości średnich w próbie. Dlatego nie piszemy H0: x̄1 = x̄2 Do celu sprawdzenia, czy te średnie x̄1 i x̄2 są równe, wystarczy spojrzeć na statystyki opisowe.

A teraz będą dziać się czary. Tak naprawdę w trakcie wykonywania analiz, test t-Studenta dla powtarzanych pomiarów zmienia się w najprostszą z tych testów wersję.

TRANSFORMACJA DANYCH SUROWYCH | W teście t-Studenta dla zależnych, jeszcze zanim dane wejdą do analiz, przechodzą pewną przemianę - transformację. Polega ona na odjęciu wyników z drugiego pomiaru od wyników z pierwszego pomiaru, czyli na obliczeniu różnicy między pomiarami. Dwa zestawy wyników zostają sprowadzone do jednego zestawu - zawierającego różnice. Dla każdej obserwacji zostaje obliczona różnica między pomiarami. W ten sposób test t-Studenta dla dwóch grup zależnych staje się jednopróbowym testem t-Studenta (ang. one-sample t-test), takim najprostszym testem, w którym średnia jednej zmiennej jest porównywana do jakiejś wartości referencyjnej. Taki test jest stosowany np. w analizie, której celem jest sprawdzić czy wybrana kategoria badanych ma określony średni poziom interesującej Cię cechy, np. μ = 120 Hg (ciśnienie skurczowe) u cukrzyków.

Jak to się dzieje, że test t-Studenta dla grup zależnych staje się testem t-Studenta dla jednej grupy? Wszystko właśnie przez tę transformację. Zobacz, przenosząc średnią zmiennej zależnej drugiego pomiaru μ2 z prawej na lewą stronę, otrzymujemy różnicę średnich między pomiarami μ1 - μ2. Wyrażenie po lewej stronie zostaje porównane do zera μ1 - μ2 = 0.

HIPOTEZA ZEROWA W NOWEJ ODSŁONIE | Ponieważ wykonaliśmy operację na surowych danych i zmieniliśmy ich strukturę, hipoteza zerowa również zmieni postać. Zamiast porównywać średnie oryginalnej zmiennej w dwóch pomiarach, teraz porównujemy bezpośrednio do zera średnią różnic zmiennej zależnej między dwoma pomiarami. Oto nowa postać hipotezy zerowej:

H0: μD = 0

JAK TO ROZUMIEĆ? | Ten zapis oznacza, że oczekujemy, aby w populacji średnia różnic była równa zero. Średnio jednak nie znaczy, że wszyscy na raz. Nie oczekujemy, że dla każdej potencjalnej jednostki różnica nasilenia zmiennej zależnej między pomiarami będzie wynosić dokładnie zero. Chodzi o to, aby różnice były najczęściej blisko zera, zaś wyniki coraz to dalsze od niego, pojawiały się coraz rzadziej.

Hipoteza alternatywna H1

HIPOTEZA ALTERNATYWNA W NHST | Hipoteza alternatywna H1 w paradygmacie NHST często wygląda bardzo mgliście. Z grubsza, można ją zapisać:”H1 nieprawda, że H0”, więc zaprzeczenie H1: μ1 ≠ μ2 oznacza brak równości między średnimi zmiennej zależnej między pomiarami. Gwoli ścisłości, ponieważ zajmujemy się średnimi różnic, równie dobrze moglibyśmy napisać H1: μD ≠ 0

Często hipotezę alternatywną H1 traktuje się jako statystyczny odpowiednik hipotezy badawczej. Odpowiednik, ponieważ jest przełożeniem hipotezy badawczej na język symboli statystycznych. Badacz zazwyczaj ma sprecyzowany kierunek zależności. Oczekuje konkretnej nierówności między średnimi, np. że po poddaniu osoby badane działaniu jakiegoś bodźca nastąpi wzrost wyników. To powoduje, że hipoteza alternatywna również dotyczy średnich nasileń (poziomów) tej samej zmiennej zależnej między dwoma pomiarami, a znak arytmetyczny jaki stoi pomiędzy mógłby być znakiem mniejszości, większości, albo nierówności. W ten sposób mamy trzy warianty hipotezy alternatywnej H1:

  • LEWOSTRONNA H1: μ1 < μ2 — np. pod wpływem działania eksperymentalnego wzrasta średnie nasilenie badanej zmiennej
  • OBUSTRONNA H1: μ1 ≠ μ2 — np. działanie eksperymentalne zmienia średnie nasilenie badanej zmiennej, ale nie wiadomo, czy podwyższa, czy obniża
  • PRAWOSTRONNA H1: μ1 > μ2 — np. pod wpływem działania terapeutycznego spada średnie nasilenie badanej zmiennej. 

ZAŁOŻENIA TESTU t-STUDENTA DLA GRUP ZALEŻNYCH
Każdy test statystyczny dane powinny mieć odpowiedni format, aby dało się ten test zastosować. Te wymogi nazywają się
założeniami testu.

FORMAT DANYCH | Zanim poznamy wymogi, przypomnę, że oględzinom poddajemy nie dane z obu pomiarów, a wynik ich transformacji, czyli różnice między pomiarami. Jak wyżej mówiliśmy, hipoteza zerowa o braku różnic między średnimi wartościami w pomiarach H0: μ1 = μ2 stała się hipotezą zerową o zerowej średniej różnicy między pomiarami H0: μD = 0. Tu koncentrujemy się na nowym, pojedynczym zestawie wyników (różnicach między pomiarami). Dzięki temu, z różnych możliwych oczekiwań co do do rozkładu zmiennej zależnej zostanie nam tylko jedyna (spoiler: normalność rozkładu).

NORMALNOŚĆ ROZKŁADU (RÓŻNIC) | Kiedy przekształcimy dane z dwóch kolumn i powstanie nam trzecia kolumna, będzie ona zmienną, której normalność badamy. Wygląda na to, że badamy normalność rozkładu nie surowych wyników - dwóch odrębnych zmiennych - a różnic między pomiarami. Badanie normalności oznacza, że badamy, czy występowanie poszczególnych wyników jest podyktowane prawem rozkładu normalnego. Rozkład normalny to specyficzny przepis na pojawianie się obserwacji. Mówi on, że najczęściej będą pojawiać się wyniki z okolicy średniej, a czym "dziwniejsza" obserwacja, tym mniejsza szansa, że wystąpi.

➡️ Jeśli chcesz dowiedzieć się, jak diagnozować normalność tymi metodami, zajrzyj do posta pt. Diagnostyka normalności: KLIK

HOMOGENICZNOŚĆ WARIANCJI | W porównaniu z testem t-Studenta dla niezależnych, w wariancie tego testu dla grup zależnych, nie obowiązuje nas badanie homogeniczności wariancji badanej cechy. Skupiając się na różnicach między pomiarami, skupiamy się na jednym zestawie danych. Pewnie nikt nie zauważył, jak gładko przeszliśmy z testu t-Studenta dla dwóch prób do testu t-Studenta dla jednej próby. Tak - test t-Studenta dla prób zależnych to tak naprawdę test t-Studenta dla jednej próby (one sample t-test), gdzie tą jedną próbą są różnice. Nie ma grup, w których mielibyśmy porównywać wariancje. Zostaje tylko badanie normalności rozkładu, ale różnic między pomiarami.

POWSTAWANIE STATYSTYKI TESTOWEJ TESTU t-STUDENTA (DLA GRUP ZALEŻNYCH)

ZACHOWANIE ŚREDNIEJ RÓŻNIC | Zanim omówimy statystykę testową – a potem jej rozkład – zastanówmy się dlaczego nie moglibyśmy po prostu porównywać średnich? W pojedynczej kolumnie, w każdym z jej wierszy znajduje się różnica między pomiarem pierwszym i drugim dla każdej osoby badanej. Pamiętasz, wcześniej mówiliśmy o transformacji danych. Wówczas zrezygnowaliśmy z surowych danych i została nam jedna kolumna z transformowanymi danymi tj. z różnicami między pomiarami. Co by się teraz stało, gdybyśmy policzyli średnią arytmetyczną tych różnic? Czego moglibyśmy spodziewać się po tej liczbie?

Gdyby średnia arytmetyczna różnic wynosiła 0, oznaczałoby to, że – średnio rzecz biorąc – manipulacja eksperymentalna nie przyniosła żadnego efektu. Wyniki w drugim pomiarze są ogólnie (średnio) takie same jak w pierwszym. Nie znaczy to oczywiście, że każda osoba ma dwa jednakowe wyniki w obu pomiarach (np. tu i tu 5), ale że średnie arytmetyczne oryginalnej zmiennej zależnej w obu pomiarach są równe.

Ktoś mógłby powiedzieć: niech ta średnia różnic będzie statystyką testową testu t-Studenta dla zależnych. Problem jednak jest taki sam, jak w teście t-Studenta dla niezależnych. Średnia arytmetyczna nie wykrywa rozproszenia wyników. Tę samą średnią arytmetyczną mogą mieć zbiory o dużym rozproszeniu, jak i o małym rozproszeniu, a stopień rozproszenia to ważna informacja. Uczeń, który ma same tróje jest bardziej stabilnym uczniem niż taki, który ma albo 1 albo 5. Trzeba wykonać jedno małe działanie, aby uwzględnić zmienność wyników, średnia arytmetyczna jest dzielona przez błąd standardowy średniej.

POWSTAWANIE STATYSTYKI TESTOWEJ | Wszystkie warianty testu t-Studenta posiadają tę samą ideę statystyki testowej. Punktem wyjścia do jej stworzenia było to, że nie można polegać tylko i wyłącznie na porównywaniu średnich. Zwykła różnica między średnimi nie oddaje tak tego, co naprawdę dzieje się w danych. Rozwiązaniem jest jest odejściu od surowych wyników poprzez tzw. studentyzację.

Statystyka testowa t-Studenta

Technicznie rzecz biorąc, studentyzacja średniej arytmetycznej to nic innego jak podzielenie średniej przez jej błąd standardowy (ang. standard error, SE). Po prawej stronie widzisz przepis na tę statystykę testową. Mała litera t oznacza wartość statystyki testowej t-Studenta, która powstaje przez podzielenie średniej różnic x̄d przez błąd standardowy średniej (który sam jest ilorazem odchylenia standardowego s i liczby obserwacji n).

CO TO JEST BŁĄD STANDARDOWY ŚREDNIEJ? | Zauważmy, że średnia arytmetyczna w próbie jest tylko pewnym oszacowaniem średniej w populacji. O ile nie mamy przebadanej całej populacji, musimy się pogodzić z dozą niepewności wynikającą z faktu, że posiadamy wiedzę tylko o wycinku populacji. Ta miara niepewności to właśnie błąd standardowy.

Błąd standardowy średniej mówi o tym, jak dobrym oszacowaniem średniej w populacji μ jest uzyskana w próbie średnia arytmetyczna x̄. Na ten błąd składają się dwie rzeczy: stopień rozproszenia wyników w formie odchylenia standardowego s oraz liczba jednostek badanych n. Dlaczego tak? Nawet na chłopski rozum można wywnioskować, że stopień rozproszenia jednostek wpływa na zawartość informacyjną naszej próby. Im bardziej skoncentrowane wokół średniej wyniki, tym bardziej precyzyjny wynik. Im bardziej rozstrzelone - tym mniej. Równie dobrze to samo można powiedzieć o liczbie osób badanych. Im więcej jednostek badanych, tym bardziej precyzyjne są nasze wskaźniki. Zaś im bardziej rozproszone wyniki osób badanych, tym mniejsza precyzja.

CO DAJE STUDENTYZACJA? | Kiedy podzieli się średnią arytmetyczną przez jej błąd standardowy, otrzymamy nową liczbę, która będzie działać jak wskaźnik tego, jak wiele informacji znajduje się w próbie - w stosunku do szumu, który zawiera każda próba. Jak wiemy, zmienność wyników osób badanych ma dwa źródła - albo jest efektem manipulacji eksperymentatora (a to wyraża się w średniej arytmetycznej) - albo efektem przypadku. Studentyzacja pozwala zbadać stosunek jednej do drugiej.

O CZYM MÓWI WARTOŚĆ STATYSTYKI TESTOWEJ t-STUDENTA? | Już sama wartość statystyki testowej t-Studenta jest w stanie nam powiedzieć, co stało się w danych. Jaką wartość możemy zobaczyć? Statystyka testowa t-Studenta przyjmuje wartości od minus nieskończoności do plus nieskończoności. Przykładowo, możesz zobaczyć dodatnią t = +3.4, ujemną t = -0.58 oraz zerową t = 0.00. Nie każda wartość statystyki ma taką samą wagę.

Jak można domyślić się, gdy statystyka testowa t-Studenta wynosi zero, t = 0.00, wówczas średnia w pierwszym pomiarze jest taka sama jak średnia w drugim pomiarze. To bardzo mocny znak tego, że celowe działanie badacza - manipulacja eksperymentalna czy zastosowany bodziec - nie wywołuje żadnej reakcji u osób badanych.

Czy w takim razie wszystkie wartości różne od zera oznaczają, że średnie różnią się? Jeszcze nie. Na szczęście, jest pewna reguła. Wokół zera rozciąga się przedział wartości statystyki testowej t-Studenta, który sygnalizuje, że w danych nic nie ma. Jego granicami są: - 1 i +1. Jeśli wartość statystyki t znajdzie się w przedziale [-1, 1], wówczas dla badacza jest to znak, że zaprojektowana przez badacza manipulacja eksperymentalna nie zadziałała. Ściślej rzecz biorąc, może i zadziałała, ale jej działanie jest zbyt słabe, aby test mógł to wykryć. Na jednych zajęciach studentka ochrzciła ten przedział mianem przedziału śmierci. Zabawna nazwa, ale jednak coś w tym określeniu jest - coś, co sprawia, że ono tak dobrze pasuje. Faktycznie, te wartości statystyki testowej, które znajdą się w nim, np. t = - 0.58 albo t = 0.31, zdradzają, że w badaniu nic nie wyszło, że średnie nasilenie badanej zmiennej w pierwszym pomiarze jest bardzo zbliżone do średniego nasilenia zmiennej w drugim pomiarze. Jednocześnie, możesz być prawie pewien, że test pokaże wynik nieistotny statystycznie.

Za to im dalej od tych granicznych wartości -1 i +1, tym lepiej. Im wyższa liczbowa (tj. bez względu na znak) wartość statystyki testowej t-Studenta, tym bardziej bodziec zadziałał na osoby badane. Co więcej, im dalej od tych wartości, tym niższa p-wartość. Najczęściej będziesz obserwować istotność statystyczną w teście.

Pamiętaj, że zajmujemy się zjawiskami empirycznymi, w których wyniki są naznaczonymi przypadkową losowością. Zróżnicowanie naszych danych ma dwa podstawowe źródła: przypadek oraz faktyczne efekty zamierzonych działań badacza. Klasyczne testowanie polega na oddzieleniu jednego od drugiego i celem statystyki testowej jest zbadanie jak wiele zmienności wyników, których źródłem jest eksperyment, zawierają nasze dane. Odbywa się to właśnie za pomocą statystyki testowej. W ten sposób klasyczne statystyki testowe ujawniają ilość informacji zawartej w danych w stosunku do wszechobecnego w świecie czysto losowego szumu.

Gdy już wiemy, jak połączyć informację z danych i wyrazić ją w postaci statystyki testowej, zwanej statystyką t-Studenta i wiemy, co ona sama do nas mówi, pojawia się kolejne pytanie - jak często zdarza się otrzymana w danym badaniu wartość statystyki testowej? Czy wartość t = -0.58 jest rzadka, czy częsta? Odpowiedź na to pytanie kryje się w rozkładzie wartości statystyki testowej, który nosi tę samą nazwę co sam test i jego statystyka: rozkład t-Studenta.

ROZKŁAD, CZYLI JAK CZĘSTO ZDARZA SIĘ OTRZYMANA W BADANIU WARTOŚĆ STATYSTYKI TESTOWEJ? | W statystyce klasycznej istnieje określony sposób postępowania podczas weryfikacji hipotez. Mamy bazę danych, której wyniki mają posłużyć do weryfikacji postawionej hipotezy badawczej. Ponieważ będziemy dokonywać wnioskowania o całej populacji, to musimy wyjść poza zwykły opis próby i sięgnąć po bardziej zaawansowane narzędzia niż statystyki opisowe. Pomysł jest taki, że sprawdzić, jak prawdopodobne są te wyniki. Co mam na myśli, używając w poprzednim zdaniu słowa: "wyniki"? Oczywiście, nie może już chodzić o surowe dane osób badanych - te, które są w bazie danych. Mogłoby chodzić o różnicę między pomiarami, ale tym razem chodzi o coś dalej. O wartość statystyki testowej, która też jest transformacją danych. Jak widzisz, testowanie polega na ciągłym przekształcaniu danych. To tutaj zadajemy pytanie, jak prawdopodobna jest uzyskana w teście wartość statystyki testowej t-Studenta. I tu wchodzimy na kolejny krąg statystycznego wtajemniczenia: nie da się tak po prostu spytać o prawdopodobieństwo jakiegoś wyniku testu.

Chodzi o kontekst. Zdarzenia są bardziej prawdopodobne w jednym kontekście, i mniej prawdopodobne w innym. Pytanie o to, jak często pojawia się konkretna wartość statystyki testowej, np. t = -0.58 albo t = 0.31, odbywa się również w pewnym kontekście. W przypadku klasycznego testowania, jest to przyjęcie założenia o prawdziwości hipotezy zerowej H01 = μ2.

A więc, tak naprawdę zadajemy następujące pytanie: jeśli nie byłoby różnic między pomiarami, to jak prawdopodobna jest uzyskana wartość statystyki testowej t-Studenta? Inaczej mówiąc, jeśli manipulacja eksperymentalna nie działa, to jak typowa jest uzyskana wartość statystyki testowej t?

Na to pytanie odpowiada się za pomocą rozkładu wartości statystyki testowej. W tym wariancie testu t-Studenta jest to rozkład t-Studenta.

KAŻDY ROZKŁAD OPOWIADA PEWNĄ HISTORIĘ... Mówi nam o tym, co będziemy obserwować pod kątem badanej cechy. Które wartości będą występować częściej, które rzadziej. Te, które badacz będzie obserwować częściej, to te, nad którymi widzimy szczyt rozkładu tworzący górkę. Te, które rzadziej będą się pojawiać, to te, które leżą w ogonach rozkładu. Wiedząc to wszystko, przeanalizujmy kształt rozkładu statystyki testowej testu t-Studenta dla grup zależnych.

Oceniając, które wartości statystyki testowej są typowe, a które nie, pamiętaj o tym, że przyjęliśmy założenie o prawdziwości hipotezy zerowej H0.

Rozkład wartości statystyki testowej t-Studenta. Nad szarym przedziałem śmierci od -1 do + 1 widzimy najwyższy punkt rozkładu - szczyt. Gdy hipoteza zerowa jest prawdziwa, to najczęściej spodziewamy się właśnie takich wartości, które sygnalizują, że w danych nic nie ma.

Rozkład t-Studenta, który widzimy na rysunku, mówi, że jeśli bodziec nie zadziałał i pomiary jednostek są podobne, to powinniśmy najczęściej obserwować wartości bliskie zero. Zobacz na powyższym rysunku, że nad przedziałem śmierci, znajduje się szczyt rozkładu. Łącznie, wartości z tego przedziału zgarniają największą szansę wystąpienia. Im bardziej wartość statystyki testowej różni się od zera, tym jest mniejsze prawdopodobieństwo jej wystąpienia - jeśli H0 ma być prawdziwa. Zauważ też, że kształt tego rozkładu jest symetryczny. Ten rozkład jednakowo traktuje wartości ujemne, jak i dodatnie. Szansa na uzyskanie wartości większej od +1 jest taka sama, jak szansa na uzyskanie wartości niżej od -1.

Od czego zależy kształt tego rozkładu? Od czegoś, co nazywa się liczbą stopni swobody (ang. degrees of freedom). To taki parametr, który często jest uzależniony od liczby osób badanych. W przypadku testu t-Studenta wynosi on df = N - 1, a więc jest to liczba osób badanych pomniejszona o jeden. Gdy w badaniu weźmie udział N = 30 osób, to df = 30 - 1 = 29.

Rozkład t-Studenta ma ciekawą własność. Jego ogony są grubsze od ogonów rozkładu normalnego, przez co częściej obserwowane są wartości skrajne. Natomiast, gdy próba rośnie i rośnie, ogony coraz bardziej przypominają ogony rozkładu normalnego. Teoretycznie, gdybyśmy dysponowali nieskończoną próbą, rozkład t-Studenta byłby rozkładem normalnym.

DO CZEGO POTRZEBNY JEST ROZKŁAD STATYSTYKI TESTOWEJ? | Na podstawie rozkładu wartości statystyki testowej obliczana jest tzw. istotność statystyczna, czyli p-wartość (ang. p-value). P-wartość jest miarą zgodności danych z hipotezą zerową testu statystycznego, na podstawie którego ją obliczono (tu: testu t-Studenta dla grup zależnych). Z technicznego punktu widzenia, jest tym prawdopodobieństwem wystąpienia otrzymanej w teście wartości statystyki testowej - o ile manipulacja eksperymentalna nie przynosi żadnego skutku.

Sama p-wartość - sama istotność statystyczna - nie daje podstaw do twierdzenia, czy hipoteza badawcza została potwierdzona. Do tego trzeba wykonać nieco więcej kroków.

WIELKOŚĆ EFEKTU W TEŚCIE t-STUDENTA DLA GRUP ZALEŻNYCH

O WIELKOŚCI EFEKTU | Ponieważ istotność statystyczna wyniku nie jest synonimem dużej siły zależności między zmiennymi (tu oznaczałoby to, że manipulacja eksperymentalna powoduje dużą zmianę zmiennej zależnej między pomiarami), to badacz musi zwrócić się do innego narzędzia celem oceny wielkości swojego odkrycia. I tu przydatna okazuje się wielkość efektu (ang. effect size). Wielkość efektu to miara siły związku między zmiennymi i w przypadku porównań między dwoma średnimi (nasileniami) najczęściej wykorzystuje się wielkość efektu d-Cohena. d oznacza difference (ang. różnicaa Cohen to nazwisko autora tej miary.

JACOB COHEN | Cohen był amerykańskim psychologiem, o którym można byłoby powiedzieć, że lubił statystykę. Jako jeden z niewielu psychologów widział wady procedury testowania NHST i robił wszystko, aby ulepszyć analizy statystyczne prowadzone przez psychologów-badaczy. Rozwijał analizę mocy, aby badacze nie przegapiali efektów i upowszechniał wskaźniki siły zależności, aby nie opierali się jedynie na istotności statystycznej.

WIELKOŚĆ EFEKTU d-COHENA | Aby zbadać, czy średnie nasilenie zmiennej w pierwszym pomiarze naprawdę różni się od średniego nasilenia zmiennej w drugim pomiarze, wykorzystuje się wskaźnik zwany d Cohena. Nie jest on zwykłą różnicą między średnimi zmiennej zależnej a standaryzowaną. Standaryzacja oznacza podzielenie przez odchylenie standardowe. W ten sposób bierze się pod uwagę zarówno różnicę między średnimi, a także stopień rozproszenia wyników. Siła zależności zależy przecież nie tylko od tego, jak bardzo średnia spadła czy wzrosła, ale także od wyraźna jest to zmiana.

WŁASNOŚCI WIELKOŚCI EFEKTU d-COHENA
  • jest to pojedyncza liczba
  • przyjmuje wartości od minus nieskończoności do plus nieskończoności; czyli d może być dowolną liczbą
  • gdy jest równa zero, wówczas średnie arytmetyczne w dwóch pomiarach są sobie równe
  • aby dowiedzieć się, czy otrzymana w badaniu wielkość efektu jest mała czy duża, należy skorzystać z progów (ang. benchmarków), np. systemu progów Cohena.

ROZMIARÓWKA COHENA | Poniżej znajduje się system progów stworzony przez Cohena w 1988.

Według tej rozmiarówki, gdy wielkość efektu d-Cohena wynosi d = 0.25, to siła zależności jest mała i wyższa od niej jest np. d = -0.79

Pewnie spytasz, czy Cohenowi nic nie pomyliło się. Wygląda na to, że duże wielkości efektu, d > 0.8 oraz d < - 0.8, zajmują największy obszar osi liczb rzeczywistych. Otóż, nie, Cohen nie popełnił błędu. Nic mu się nie pomyliło. W psychologii wielkości efektu d nie są ogromne, zwykle lokują się blisko zera.

ROZMIARÓWKA LOVAKOVA i AGADULLINY | Od końca lat osiemdziesiątych minęło już trochę czasu i system Cohena zestarzał się, niekoniecznie elegancko. W wielu subdziedzinach psychologii powstały nowe, bardziej adekwatne do specyfiki badań w takiej poddziedzinie. W psychologii społecznej funkcjonuje nieco inny system benchmarków:

Zauważ, że przesunęły się granice. W tej rozmiarówce, d = 0.18 jest już małą wielkością efektu.

Błędy I i II rodzaju

LUTY 2025| LJK | ~2 000 słów| W trakcie poprawek

Ideę błędów I-go i II-go rodzaju zwykle przedstawia się w konkretny sposób. W procedurze NHST, badacz stawia hipotezę zerową, która - jak sama nazwa wskazuje - jest hipotezą o braku zależności. Oznacza ją H0 a następnie stawia drugą hipotezę, która treściowo jest do niej przeciwna, tzw. hipotezę alternatywną oznaczaną H1. Jedna hipoteza mówi, że coś istnieje, druga - że nie istnieje, zaś zadaniem badacza jest wybrać, która z nich jest tą prawdziwą - tą, która dobrze opisuje rzeczywistość. Wybierając źle, może pomylić się na dwa sposoby.


SPIS TREŚCI:

Błąd I i II-go rodzaju

Badacz popełni błąd, odrzucając prawdziwą hipotezę zerową H0 (i tym samym przyjmie fałszywą hipotezę alternatywną H1), albo przyjmując fałszywą hipotezę zerową (i tym samym odrzuci prawdziwą hipotezę alternatywną). Pierwszy błąd nazywany jest błędem I-go rodzaju. Drugi błąd jest nazywany błędem II-go rodzaju. Te błędy mają różne nazwy w różnych kontekstach. Wynik testu medycznego, w którym popełniono błąd I-go rodzaju, nazywa się fałszywie dodatnim (false positive), zaś wynik, w którym popełniono błąd II-go rodzaju, nazywa się fałszywie negatywnym (false negative). Z powodu odmiennych konsekwencji, jakie dla nauki niosą te błędy, błąd I-go rodzaju bywa kojarzony ze złudnymi artefaktami, a błąd II-go rodzaju - z przeoczeniami. Aby zrozumieć relację między błędami, najlepiej jest mieć wszystko czarne na białym - i na brązowym. Oto rysunek przedstawiający błędy w relacji do rzeczywistości.

BŁĄD I-GO RODZAJU, α - To błędne odrzucenie prawdziwej hipotezy zerowej H0. Choć hipoteza zerowa H0 jest prawdziwa, badacz odrzuca ją, popełniając przy tym ten błąd. Jeśli ją odrzuca, to musi wówczas przyjąć hipotezę alternatywną H1, a ta jest fałszywa. Skoro hipoteza zerowa jest tą o braku efektu (badanego zjawiska), to odrzucenie jej automatycznie oznacza przyjęcie, że zjawisko istnieje. W ten sposób można obawiać się, że do nauki będą wchodzić tzw. artefakty - nieistniejące efekty. Będziemy uznawać, że istnieją duchy, a tymczasem przecież one nie istnieją - prawda?

BŁĄD II-GO RODZAJU, β - To błędne odrzucenie prawdziwej hipotezy alternatywnej H1. Tym razem, to hipoteza alternatywna H1 jest prawdziwa, ale badacz odrzuca ją, popełniając przy tym ten typ błędu. Skoro hipoteza alternatywna mówi o istnieniu jakiegoś zjawiska, to odrzucenie jej automatycznie oznacza przyjęcie hipotezy o jego braku, nieistnieniu. W praktyce, oznacza uznanie, że dany lek jest nieskuteczny, terapia - nie działa, a ktoś nie spełnia jakichś wymogów. Dlatego błędy II-go rodzaju są nazywane błędami przeoczenia.

| Martwiąc się popełnieniem błędów I-go rodzaju, obrastamy w błędne przekonania, a potem mnóstwo energii zabiera nam usunięcie błędu II-go rodzaju.

Samo zrozumienie idei błędów I i II rodzaju raczej nie powinno sprawiać problemów. Kiedy czytasz te słowa,  już jesteś na tym etapie życia, że masz już za sobą popełnienie każdego z nich - i to wiele razy. Ile razy błędnie założyłeś, że podobasz się dziewczynie (błąd II-go rodzaju)? Ile razy okazało się, że odrzuciłaś fajnego faceta, bo wydawał się beznadziejny (błąd I-go rodzaju)? Ile razy myślałaś, że wystarczy jeszcze szamponu w butelce, a okazywało się, że nie (błąd I-go rodzaju). A ile razy myślałeś, że nie uda się, a jednak udawało się? W życiu codziennym wciąż popełniamy mniejsze i większe błędy obu rodzajów. Martwiąc się popełnieniem błędu I-go rodzaju, obrastamy w błędne przekonania na temat siebie, życia i drugiego człowieka, a potem mnóstwo czasu i energii zabiera nam usunięcie błędów II-go rodzaju.

Koszmar z błędami I i II rodzaju leży w zupełnie innym miejscu - w żonglerce słowami. Zobacz, napisałam:"błąd I-go rodzaju to błędne odrzucenie prawdziwej hipotezy zerowej", ale też "błędne przyjęcie fałszywej hipotezy alternatywnej". Oba zdania są prawdziwe i wyrażają ten sam stan rzeczy - różnią się tylko perspektywą. To pierwsze jest pisane z perspektywy wystawionej za drzwi hipotezy zerowej, a to drugie - z perspektywy konia trojańskiego, hipotezy alternatywnej.

Jeśli w poprzednim akapicie miałeś trudności ze zrozumieniem fraz, to wiedz, że nie wynika z tego, że błędy to skomplikowane pojęcia albo, że to Ty nie rozumiesz matematyki - to po prostu kwestia językowa. W zdaniach opisujących błędy występuje nieprzyjemny miks abstrakcyjnych pojęć ("błąd", nie można pokazać błędu na tej samej zasadzie jak można pokazać krzesło), powtórzeń ("błąd", "błędny"), które zestawiono ze słowami o przeciwnym znaczeniu ("prawdziwy", najpierw pojawia się coś "błędnego", a nieco dalej - coś "prawdziwego"). Na dodatek wszystko osadzono w zdaniu o konstrukcji biernej, gdzie nie ma aktywnego podmiotu ("błędne odrzucenie"). W takich wypadkach wystarczy sekunda nieuwagi - i już można się zgubić. Zawsze, gdy na wykładzie mam mówić o błędach I i II rodzaju, mój mózg pracuje na podwyższonych obrotach, bo wiem, że ja sama nie mogę się pomylić 😁.


Mężczyzna w ciąży i nieciężarna ciężarna

Wszystko, co powyżej zostało napisane, jest na wysokim poziomie ogólności, dlatego czas na przykład. Błędem I-go rodzaju jest stwierdzenie, że zjawisko istnieje, gdy ono nie występuje. Świetnym przykładem obrazowo ilustrującym ten rodzaj pomyłki, jest uznanie, że mężczyzna jest w ciąży. Badanie obwodu brzucha jest rozsądne - podczas ciąży brzuch rośnie. Niestety, czasami rośnie z innych powodów niż ciąża, a to badanie nie ma sensu w przypadku mężczyzn.

Błędem II-go rodzaju jest przeoczenie zjawiska, gdy ono naprawdę istnieje. W tym przypadku mamy kobietę w wyraźnej ciąży z badaniem USG ujawniającym płód. Tym razem lekarz myli się i mówi, że ona w ciąży nie jest. 


5% i 20% - akceptowalne poziomy błędów I i II rodzaju

Zwyczajowo przyjmuje się, że poziom błędu I-go rodzaju wynosi 0,05 lub: 5% zaś poziom błędu II-go rodzaju wynosi 0,20 lub: 20%.

Trudno powiedzieć, że wysokość tych progów wynika z jakiegoś twierdzenia matematycznego. Nie są też - jak stałe fizyczne - efektem serii pomiarów, które wskazałyby ich wysokość. Są po prostu... efektem umowy w środowisku naukowym - umowy zaproponowanej przez Ronalda Fishera oraz Jacoba Cohena. Ten pierwszy wskazał, że 5% próg błędów I-go rodzaju będzie dobrym poziomem pomyłek fałszywie pozytywnych. Ten drugi wskazał wartość 20%. I tak zostało.

Co nie oznacza, że tak musi być. Jak to bywa z umowami, można je zmieniać. Istnieją badania, w których testy mają inny niż pięć procent poziom błędów I-go rodzaju i inny niż dwadzieścia procent poziom błędów II-go rodzaju. Ten pierwszy może wynosić nawet 1%, jeśli chcemy być bardziej surowi. Może wynosi 10% - jeśli chcemy być bardziej liberalni. O testach liberatlnych i konserwatywnych porozmawiamy za chwilę.


Co znaczy, że błąd jakiegoś rodzaju wynosi 5% lub 20%?

Co to znaczy, że błąd I-go rodzaju wynosi 5%? Chciałoby się powiedzieć, że to w ilu procentach mylimy się, jeśli zależność nie istnieje. Innymi słowy, gdy hipoteza zerowa jest prawdziwa, mamy pięcioprocentową szansę pomylić się. Uważaj tutaj - poprzednie zdanie jest tak skonstruowane, aby uśpić Twoją czujność. Kluczem do zrozumienia błędu I-go rodzaju jest słowo "szansa". Co to w ogóle znaczy: “szansa” lub "prawdopodobieństwo"?

| Kluczem do zrozumienia błędu I-go rodzaju jest słowo "szansa".

Błąd I i II-go rodzaju to idee pochodzące z jednej ze szkół statystyki. Szkół? – pomyślisz. Tak, szkół w liczbie mnogiej. Wbrew przekonaniom, statystyce daleko od ujednoliconej dziedziny wiedzy. Wciąż ścierają się w niej różne idee. Proces testowania hipotez, ten z istotnością statystyczną, to efekt połączenia dwóch szkół, a tylko w jednej z nich pojawiają się błędy I i II rodzaju. Koncepty noszą w sobie sposób myślenia twórcy. W przypadku błędów jest to tzw. częstościowa interpretacja prawdopodobieństwa. Aby naprawdę zrozumieć, co znaczy pięcioprocentowa szansa popełnienia błędu I-go rodzaju - lub dwudziestoprocentowa błędu II-go rodzaju - w trakcie weryfikacji hipotez statystycznych, należy zgłębić coś, co stanowi jej sedno.


Częstościowa interpretacja prawdopodobieństwa w służbie błędów I i II rodzaju

Wyobraź sobie, że rzucasz złotówką. Na jednej stronie ma orła, na drugiej wybito napis "1 złoty". W języku angielskim o monecie, która jest dobrze wyważona, mówi się, że jest fair - uczciwa. Szansa otrzymania orła podczas rzucania uczciwą monetą jest taka sama jak reszki, czyli ½. Co praktycznie oznacza ta liczba ½ ? Czy to, że otrzymamy pół orła i pół reszki? Że moneta spadnie na brzeg? Nie. Ta jedna druga oznacza, że gdybyśmy długo rzucali tą monetą, stosunek liczby otrzymanych orłów do liczby rzutów zbliżałby się ku ½. Taka jest częstościowa interpretacja prawdopodobieństwa - opowiada ona o tym, co zdarzy się het, daleko za horyzontem powtarzanych zdarzeń. Powtarzanym doświadczeniem losowym może być rzucanie monetą albo kostką. Równie dobrze to też może być badanie z zakresu psychologii, w którym postawiono dwie hipotezy.


Co znaczy, że błąd I rodzaju wynosi 5%?

Pięcioprocentowy błąd I-go rodzaju oznacza, że gdybyśmy prowadzili to samo badanie wiele razy a zjawisko nie istniałoby, to po jakimś czasie zauważylibyśmy, że istnieje pewien odsetek replikacji, które mimo wszystko pokazują pozytywny wynik - pokazują, że zjawisko istnieje. Odsetek takich wyników testu wynosiłby pięć procent.


Co znaczy, że błąd II rodzaju wynosi 20%?

W podobny sposób należy myśleć o błędzie II-go rodzaju. Dwudziestoprocentowy błąd II-go rodzaju oznacza, że gdybyśmy prowadzili to samo badanie wiele razy, a badane zjawisko naprawdę istniałoby, to zauważylibyśmy, że są takie wyniki testu, które mylą się, pokazując, że zjawisko nie istnieje. Odsetek takich replikacji wynosiłby właśnie dwadzieścia procent.


Konsekwencje częstościowej interpretacji dla testu

Na szczęście, nie oznacza to, że musisz prowadzić tak wiele badań, aby wreszcie zobaczyć, że w pięciu procentach mylisz się. Badacz zwykle nie dysponuje więcej niż kilkoma replikacjami swojego eksperymentu. Student najczęściej ma jedno badanie - to do pracy magisterskiej. Czy to oznacza, że nie może określić błędu I-go rodzaju dla wybranego testu statystycznego? Nie. Błąd I i II rodzaju to teoretyczne koncepty. Staramy się tak dobrać parametry testu (liczebność próby, wielkość szukanej zależności), aby teoretycznie te błędy pozostawały na wybranych poziomach. "Teoretycznie" znaczy: "w odpowiednio długiej perspektywie". Gdybyśmy tę długą perspektywę oglądali, wykonując ponownie i ponownie te badania.

| Teoretycznie znaczy w odpowiednio długiej perspektywie.

To wszystko oznacza, że w jednym badaniu nie wiadomo, czy poprawnie przyjmujesz czy odrzucasz hipotezę zerową. Tego nie wiesz - ufasz, że gdyby je prowadzono i prowadzono, to jedynie w 5% błędnie odrzucano by prawdziwą hipotezę zerową. I w 20% błędnie odrzucano by prawdziwą hipotezę alternatywną.

| Nie można umrzeć w 5% a żyć w 95%.

Czy to w ogóle ma sens? - pomyślisz. Zauważ, że to rozumowanie w zupełnie innym kontekście nabiera sensu a dzieje się tak, gdy rozmawiamy o szansach na śmiertelne powikłania przy pewnej operacji. Co oznacza, że operowany pacjent ma 5% szans na zejście? Konkretny pacjent przeżyje albo nie przeżyje operacji - nie można umrzeć w 5% a żyć w 95%. O tych pięciu procentach myśli się zbiorczo - wśród operowanych pacjentów odsetek śmiertelności wynosi 5%. Co dwudziesty pacjent nie przeżyje, ale nie wiadomo na kogo padnie. Jak widzisz, częstościowy sposób rozumienia szans masz już w głowie. Wystarczy go tylko przenieść na grunt testów statystycznych.


Współzależność błędów I i II-go rodzaju

Życie uczy, że dobrze jest nie popełniać błędów. Dobrze jest nie szukać kluczy, tam gdzie ich nie ma. Dobrze jest nie szukać czegoś, co nie istnieje. Tak samo moglibyśmy zechcieć zminimalizować błąd I-go rodzaju. Najlepiej - wyzerować. Ale jeśli zaprojektujemy test, którego poziom błędu I rodzaju α był równy 0, to ceną, jaką za to zapłacimy jest maksymalizacja błędu II-go rodzaju. Jak to się dzieje?


Czy można wyzerować błędy?

KONSEKWENCJE MINIMALIZACJI BŁĘDU I-GO RODZAJU- Aby uniknąć błędu I-go rodzaju, chcielibyśmy przyjmować te hipotezy zerowe, które są prawdziwe. Projektujemy zatem test, który przyjmuje każdą hipotezę zerową. Pamiętaj, że cały czas pozostajemy w statystyce częstościowej, frekwentystycznej. Wyobraźmy sobie więc całą serię badań, a w każdym z nich przyjmujemy hipotezę zerową.

W zasadzie moglibyśmy nawet badań nie robić, bo i tak nie odrzucimy żadnej hipotezy zerowej. Nawet tej fałszywej. To z kolei prowadzi do tego, że jeśli w rzeczywistości jest jakiś efekt, jakaś różnica między grupami, czy korelacja, to i tak nie uznamy jej istnienia. A więc popełnimy błąd II-go rodzaju. W tej serii badań cały czas będziemy popełniać błąd drugiego rodzaju. To oznacza, że popełnimy 100% błędów drugiego rodzaju, chcąc wyzerować błędy pierwszego.

KONSEKWENCJE MINIMALIZACJI BŁĘDU II-GO RODZAJU - Wykorzystajmy jeszcze raz przykład prawniczy. W przykładzie prawniczym błąd II-go rodzaju oznacza błędne odrzucenie prawdziwej hipotezy alternatywnej (a brzmi ona tak: dana osoba jest przestępcą) i przyjęcie fałszywej hipotezy zerowej (dana osoba jest niewinna). Chcemy, aby było idealnie i perfekcyjnie, czyli w żadnym ze 100 przypadków nie popełnić tego błędu. Zatem w obawie przed popełnieniem błędu II-go rodzaju zwanego β profilaktycznie i przezornie uznajemy, że wszyscy oskarżeni są winni. I kropka. Co się wówczas dzieje? Przestępcy słusznie siedzą za kratkami, ale osoby niewinne również wędrują do więzienia. Błąd II-go rodzaju jest równy zero, ale zmaksymalizowaliśmy błąd I-go rodzaju.

A tak naprawdę to, chcielibyśmy zminimalizować błąd I-go i błąd II-go rodzaju. Ale one są ze sobą powiązane. Wyzerowanie błędu II-go rodzaju pociągnie zmaksymalizowanie błędu I-go rodzaju. Jaki byłby odpowiedni kompromis między poziom błędu I-go a II-go rodzaju?

Test konserwatywny i test liberalny

Chcemy, żeby poziom popełniania błędów I-go rodzaju był równy 5%. Ale czy to przypadkiem nie jest tylko myślenie życzeniowe czy zwykłe chciejstwo? Może są testy, które odrzucają więcej hipotez zerowych i testy, które odrzucają mniej? Są. Nawet mamy dla nich nazwy 😁
Test, który ma tendencję do nieodrzucania hipotezy zerowej (częściej uważa, że hipoteza zerowa jest prawdziwa), to test, którego rzeczywisty poziom błędu I-go rodzaju nie przewyższa nominalnego, najczęściej 5-procentowego progu, jest nazywany testem konserwatywnym.

Dlaczego piszę:"rzeczywisty"? Bo zawsze można w laboratorium sprawdzić, czy test naprawdę odrzuca 5%, czy może mniej. To laboratorium to są symulacje i dzięki temu wiemy, że niektóre testy mimo, że na etapie ich projektowania chcieliśmy aby myliły się dokładnie 5%, to jednak nie osiągają tego pułapu (to tylko na pozór dobrze). Pamiętaj, jeśli test jest konserwatywny, to popełnia mniej błędów I-go rodzaju, a kosztem tego jest zwiększenie błędów II-go rodzaju.

TEST KONSERWATYWNY - Wyobraź sobie wielokrotne wykonywanie tego samego badania, a więc tego samego testu. Jak sama nazwa wskazuje, hipotezy zerowe zwykle mówią o braku efektu. Za to hipotezy alternatywne - o tym, że coś istnieje, co czyni je bardziej postępowymi. Z tej perspektywy taki test, który nie chce być postępowym a pragnie zachować status quo jest testem konserwatywnym.

Jeśli badacz chce popełniać mało błędów I-go rodzaju to oznacza, że chce rzadko odrzucać prawdziwe hipotezy zerowe. Aby rzadko odrzucać prawdziwe hipotezy zerowe, trzeba rzadko odrzucać hipotezy zerowe. Żeby rzadko odrzucać atrakcyjnych partnerów, trzeba rzadko odrzucać partnerów w ogóle. Ta strategia ma swój koszt - skoro rzadko odrzucać, to znaczy częściej przyjmować hipotezy zerowe. A to oznacza, że może zdarzać się przyjmowanie fałszywych hipotez zerowych. Przyjęcie fałszywej hipotezy zerowej to odrzucenie prawdziwej hipotezy alternatywnej, a hipotezy alternatywne mówią o istnieniu jakiegoś efektu. Skoro rzadko je przyjmujemy, to jesteśmy dość konserwatywni: częściej twierdzić, że nie ma efektu niż, że jakiś jest.

Hipotezy zerowe mówią zwykle o braku istnienia jakiegoś efektu, a konserwatywny jest słowem o etymologii łacińskiej (conservare znaczy przechowywać, zachowywać) i ma znaczenie zachowawczy (‘lepiej nic nie zmieniać’), więc test, który ma tendencję do nieodrzucania hipotezy o zerowym efekcie, jest testem konserwatywnym. Taki test myśli sobi: na wszelki wypadek niczego nie wynajdę, co bym nie musiał się martwić, że społeczeństwo się zmieni.

Taki test, który w wielokrotnym powtórzeniu tego samego badania ma obniżony poziom błędu I-go rodzaju ma jednocześnie podwyższony poziom błędu II-go rodzaju.

| Test konserwatywny jest jak człowiek, który nikomu nie wybacza. Test liberalny - jak ten, który wybacza wszystko.

TEST LIBERALNY - Test liberalny to test, który nie jest testem konserwatywnym. Niektórzy nazywają je antykonserwatywnymi. Jeśli czytasz te słowa po przeczytaniu poprzedniego akapitu, najbliższa treść powinna być intuicyjna - a przynajmniej bardziej intuicyjna. Jeśli test jest testem liberalnym, to znaczy, że nie chce zachowywać ustalonego status quo. Wobec tego, będzie częściej odrzucał hipotezę zerową i - zarazem - częściej przyjmował hipotezę alternatywną. To oznacza, że spadnie mu błąd II-go rodzaju, ale jednocześnie wzrośnie błąd I-go rodzaju. Test, który ma rzeczywisty poziom alfa wyższy niż 5%, czyli mimo tego, że teoretycznie powinien popełniać nie więcej niż 5% pomyłek w rzeczywistości popełnia ich więcej.⬛️



Więcej informacji…

➡️Błąd II-rodzaju jest związany z analizą mocy - techniką statystyczną, która służy do wyznaczania potrzebnej wielkości próby. Jeśli błąd II-go rodzaju wynosi 20%, to moc testu wynosi 80%. Więcej tu: KLIK
➡️ Częstościowa interpretacja działa również w przypadku 95% przedziału ufności, który oznaczał, że gdybyśmy przeprowadzili doświadczenie wiele, wiele razy i za każdym razem obliczali przedział ufności, to 95% z nich zawierałoby prawdziwą wartość parametru. Jeden konkretny przedział ufności zawiera, albo nie zawiera - tego nie wiadomo. Podobnie tutaj: kontrolujesz błędy I-go i II-go rodzaju w teoretycznym ciągu replikacji eksperymentu, ale w konkretnym przypadku nie wiesz, jak jest.
➡️ Błąd I-go rodzaju nie jest istotnością statystyczną lub p-wartością, wbrew temu, co niektórzy piszą, a brzmi to mniej więcej tak:"Istotność statystyczna to prawdopodobieństwo popełnienia błędu pierwszego rodzaju, jeśli hipoteza zerowa jest prawdziwa." Dlaczego to problem? Momenty czasowe nie zgadzają się. Błąd I-go rodzaju jest ustalany przed przeprowadzeniem badania. Wynosi 5%. Istotność statystyczna (p-wartość) to coś, co obliczane jest po jego przeprowadzeniu.