Rachunek prawdopodobieństwa i statystyka
RACHUNEK PRAWDOPODOBIEŃSTWA - Trzymasz w ręku monetę. Wiesz, że Twoja moneta jest uczciwa. Dzięki rachunkowi prawdopodobieństwa dowiesz się, jaka jest szansa, że otrzymasz trzy orły w dziesięciu rzutach tą monetą.
STATYSTYKA - Trzymasz w ręku monetę. Wiesz, że w trzech rzutach na dziesięć wypadł orzeł. Dzięki statystyce możesz zbadać, czy ta moneta jest uczciwa.
Mam nadzieję, że czujesz różnicę. Probabilista, czyli osoba zajmująca się rachunkiem prawdopodobieństwa, wychodzi ze znajomości rozkładu szans i pyta o konkretny wynik. Statystyk ma konkretny wynik i pyta, jaki mógł być to rozkład.
Są to bardzo podobne rzeczy, ale jednak różne. Można powiedzieć, że rachunek prawdopodobieństwa i statystyka to dwie strony tego samego medalu.
Rozkład statystyki opisowej i testowej.
To teraz będzie o rozkładzie statystyki z próby i rozkładzie cechy w próbie. Szczerze mówiąc, nie wiem, czemu jest takie rozróżnienie.
Zwykle z kontekstu wiadomo, o co chodzi, a jak nie wiadomo, to trzeba dopytać. Po angielsku mamy zgrabniejsze pojęcia. Odpowiednikiem rozkładu statystyki z próby jest sampling distribution. A rozkład cechy w próbie to jest na przykład empirical distribution. Prawda, że inaczej brzmi? A w języku polskim wprowadza się rozróżnienie na podstawie przedimków (z oraz w) i można w najlepsze czatować na pomyłkę.Najpierw jednak uporządkujmy sobie pojęcie: statystyka. Statystyka to: (a) nazwa działu matematyki zajmująca się m.in. metodami zbierania i analizy danych (czyli nazwa dziedziny nauki), (b) nazwa przedmiotu (choć często też są to ”metody statystyczne” albo coś w stylu 'zaawansowane techniki analizy danych') ale też statystyka to (c) po prostu obliczony wskaźnik.
Jedno słowo mogą mieć różne znaczenia i bywa, że nie wiedząc, o które chodzi, to się mocno mieszamy.
Jeśli znaczenie pojęcia statystyka ogranicza się jedynie do dziedziny nauki, to można mieć misz-masz w głowie, … no, bo co to jest rozkład biologii?Tak, wracając do obliczonego wskaźnika... statystyki.
Wiem, że można czepiać się, ale muszę baaardzo uprościć, aby potem można było wejść na wyższy poziom,... czyli bardziej zagłębić się w tematy statystyczne.Pisząc obliczony wskaźnik, wyobraź sobie taki przykład: średnia z próby (klasyka przykładów to średnia ocen), odchylenie standardowe z próby. Tak, tak, to, co daje się liczyć na próbie zwie się statystyką.
Jeśli liczysz cokolwiek na próbie, to taki wskaźnik możesz spokojnie nazwać statystyką. Teraz są dwie drogi do wyboru: statystyka opisowa lub statystyka testowa. Jaka jest różnica?Różnica między statystyką opisową a statystyką testową.
To, co jest liczone z udziałem obserwacji w celu podsumowania informacji to są zwykle statystyki opisowe. Mediana, moda, średnia, kurtoza, skośność...
Pamiętaj, cokolwiek liczymy na próbie, to na pewno to będzie statystyka. Tyle, że albo opisowa (gdy przedstawiasz sumaryczne dane), albo testowa (gdy robisz test).Jest też bardzo obszerny post o tym, czym jest statystyka testowa. KLIK
Różność wyników w zależności od tego, jak próba trafiła się.
Najważniejsze teraz: jeśli to cokolwiek jest liczone na próbie, to znaczy, że w zależności od zebranej próby będzie miało inną wartość.
Cokolwiek = wzór, do którego wkładamy wyniki przebadanych osób.Powiedzmy taka średnia. Mając siedem klas w jednym roczniku, masz 7 średnich z ocen, po jednym dla każdej klasy. A skoro tak, to możemy sobie już zrobić podsumowanie częstości występowania wartości średnich (no, akurat na 7 średnich to będzie mało porywające zajęcie). To podsumowanie zrobimy w postaci histogramu.
Chciałabym wszystko przedstawić w postaci jednego rysunku - tego po lewej. Zrobię to krok po kroku, a na końcu pokażę go jeszcze raz. Mam nadzieję, że w ten sposób będzie łatwiej Tobie zrozumieć pojęcie rozkładu (cechy) w próbie oraz pojęcie rozkładu (statystyki) z próby.
Pinezki będą oznaczać poszczególne partie dużego rysunku. Są one przedmiotem omówienia. Na koniec poskładam to wszystko do kupy i obrazek z lewej powinien być dużo bardziej zrozumiały.
Tak, jak już zapowiedziałam, na warsztat biorę starą dobrą średnią. To po prostu klasyczny przykład, do którego najczęściej można się odwołać a potrzebny był mi wzór, ale to to tylko szablon – wszystkie pozostałe statystyki działają tak samo.0. Najpierw zobaczymy sobie rozkład wyników cechy w populacji. Zwykle przyjmuje się, że całej populacji nie można zbadać, choć czasami można go wyznaczyć dokładnie, bo np. populacja jest mała (rozkład wyników z matury wśród osób chorujących na bardzo rzadką chorobę genetyczną). Możemy też z wcześniejszych badań posiadać wiedzę o tym, jak wyniki rozkładają się w populacji. Tak czy inaczej, powiedzmy, że mam rozkład wyników pewnej cechy w populacji. Cecha ta jest zmienną ciągłą. Jej rozkład też jest ciągły i ma dwa garby.
Gdyby było tak cudownie, że wszyscy zawsze dajemy radę przebadać całą populację pod kątem wybranej cechy, to skończyłabym posta. Ale tak różowo nie ma, więc najczęściej mamy tylko (i aż) próbę i próbujemy na podstawie tej próby szacować to, co nas interesuje. Bywa, że interesuje nas cały rozkład, czyli chcielibyśmy odkryć fioletowego węża z dwoma garbami, a bywa, że chcemy szacować tylko pewien parametr takiego rozkładu, np. średnią, medianę, odchylenie standardowe. Jeśli przeprowadzasz test statystyczny (w duchu frekwentystycznym, co na 2019 r. jest typowym podejściem), to na danej próbie będziesz szukać wartości statystyki testowej.
1. Zbieramy dane. Mamy pierwszą próbę. Histogram wyników wygląda mniej więcej w ten sposób.
W tej pierwszej wylosowanej próbie średnia badanej zmiennej wynosi 3,57. Indeks dolny przy iksie x̄numer oznacza numer tej próby.
2. Robimy to samo badanie, znowu maglujemy trzydziestoosobową grupę. Wrzucamy dane w SPSS-a (albo w cokolwiek innego) i oglądamy. W drugiej próbie wylosowane obserwacje mają taki oto histogram częstości tej cechy.
Ja może przypomnę taką banalną własności: dla jednej próby jest jedna średnia x̄. Nie może być dla jednej grupy dwie średnie w tej samej zmiennej.Czynność wykonywania tego samego badania, zbierania wyników i oglądania średniej wykonujemy jeszcze dziewięćset dziewięćdziesiąt osiem razy. Bo dwa już mamy, więc 2+998 daje tysiąc.
4. Kiedy przeprowadzę tysięczne badanie, to mam tysięczną próbę i tysięczną średnią. Wynosi ona x̄1000 = 5,89.
5. A zatem mam tysiąc średnich – każda z nich pochodzi z przebadanej próby, a prób było tysiąc (jak tysiąc grup, tysiąc klas, tysiąc kół różańcowych, tysiąc zespołów...). Można z tym coś zrobić.
6. Skoro mamy bardzo duży zbiór różnych średnich, wobec tego nic nie stoi na przeszkodzie - zróbmy sobie histogram tego tysiąca średnich. Zobaczymy jakie są częstości poszczególnych wartości średnich.
7. Z tego histogramu wynika, że pierwsza średnia wpada w przedział takich średnich, które zdarzają się często. Tak samo jest z drugą średnia x2. Tysiączna średnia x̄1000 jest średnią występującą rzadziej. 8. A teraz dla zaawansowanych – powinno Wam gdzieś pobrzękiwać Centralne Twierdzenie Graniczne. Dlaczego? Dlatego, że ten czerwony histogram powinien przypominać dzwon Gaussa.
Co musiałoby się stać, aby jeszcze bardziej przypominał rozkład normalny?...Dowiemy się w następnym odcinku ;-) Gdybyśmy tam spojrzeli wiedzielibyśmy, że z n ---> nieskończoności rozkład średnich zbliżałby się do rozkładu normalnego. Uwaga: nie chodzi o zwiększanie liczby średnich tylko ilości obserwacji, które stanowią podstawę do obliczenia średnich.
a) Zwiększyć liczbę średnich? Na przykład z 1000 do 1001.
b) Zwiększyć liczbę obserwacji w obrębie jednej średniej? Na przykład z 30 do 31.
Więcej o Centralnym Twierdzeniu Granicznym tutaj: KLIK
Ale jak to? Mówi ono, że statystyka z próby, jaką jest średnia, będą coraz bardziej przypominać rozkład normalny. Od czego zależy to przypominanie? Od liczebności pojedynczych prób. Czyli, im więcej osób badanych zbadamy, tym bardziej taki prostokątowy wykres będzie zbliżać się do gładkiej krzywej dzwonowej Gaussa.
Teraz, pozbieramy wszystko do kupy i naszym oczom ukazuje się pełny obraz:
Zawsze dopytaj o co chodzi, to nie jest oczywiste, zważywszy na to, że są statystyki opisowe (średnia, mediana, odchylenie standardowe) i testowe. W końcu skazaniec siada na krześle elektryczny czy drewnianym?
Podsumowanie będzie w formie tabeli:
Brakuje mi dobrego przykładu do ostatniego wiersza. Jeśli coś przyjdzie mi do głowy, to wtedy uzupełnię ;-)
| Cześć! Dzięki za przeczytanie mojego posta. Przy okazji, mam do Ciebie małą prośbę - siedzę tu, po drugiej stronie monitora i nie widzę, czy podobała Ci się treść artykułu, czy może znużyła, może jest tego za dużo, albo było za długie (Too Long Didn't Read, TLDR). Przygotowałam kilka możliwych reakcji - proszę, podziel się swoimi odczuciami, ponieważ nie mam okazji bezpośrednio Ciebie zapytać, a jestem bardzo ciekawa. Przyda mi się to do planowania i pisania kolejnych postów. Jeszcze raz dzięki za uwagę i do zobaczenia :-) Ps. Możesz wybrać więcej niż jedną odpowiedź:-) |
Dystrybuanta rozkładu prawdopodobieństwa.
W tym poście znajdziesz takie informacje:
- po co jest dystrybuanta? - co to jest ta dystrybuanta?
- Jakie sątrzy własności dystrybuanty?
- jaka jest różnica między dystrybuantą a skumulowanym prawdopodobieństwem
- z czym ma styczność badacz? Dystrybuanta teoretyczna a empiryczna.
- dystrybuanta empiryczna - co to takiego?
- dystrybuanta a gęstość
- zobacz przykład - ułatwia zrozumienie.
- TL;DR
Zaczynamy zajęcia ze statystyki, prowadzący lub prowadząca przedstawia podstawy rachunku prawdopodobieństwa, zdarzenie elementarne, losowe i przechodzimy do zagadnienia przedstawienia jakoś szans pojawienia się wyników zmiennej losowej - rzutu monetą, kostką, okiem i beretem. I widzimy tooo O_o:
Skąd to się bierze?
Prawdopodobieństwo trzeba jakoś przedstawić. Można to zrobić w postaci:
(a) funkcji prawdopodobieństwa,
(b) gęstości,
(c) zbiorczo: w postaci skumulowanej.
W postaci skumulowanej czyli pokazać, jakie jest prawdopodobieństwo spotkania obserwacji do wybranego poziomu, np. jakie jest odsetek dzieci, który osiągnęły wzrost do danego, od najmniejszego możliwego.
Wychodzi na to, że nie wystarczy podać odsetka dzieci, które osiągnęły dany wzrost, tylko wszystkie mniejsze też. Trochę to nieintuicyjne na pierwszy rzut oka, bo na pytanie ile masz centymetrów wzrostu, odpowiadamy konkretnie: "Mam 172 cm", a nie "Do 172", ale uwierzcie mi, że to ma sens przy korzystaniu ze statystyki.
Dystrybuanta
W tym miejscu chodzi o to, aby rozmówcy zadać pytanie: 'jaka jest szansa, że Twój wzrost wynosi do 172 cm?'. To na razie załatwia sprawę skumulowania. Ale dystrybuanta to nie synonim na skumulowane prawdopodobieństwo, choć mają wiele wspólnego. Dalej okaże się, co jest różne.
Aby przekształcić rozkład prawdopodobieństwa (podany w powyższej postaci) do dystrybuanty należy w kolejno dodawać do siebie wartości tego prawdopodobieństwa. Na pierwszym miejscu jest liczba oczek, na drugim miejscu skumulowane prawdopodobieństwo uzyskania liczby oczek do podanej:
W przypadku rozkładów dyskretnych (rozkład dyskretny? klik), takich jak rzut kostką (monetą również) punkty, których następuje dodanie prawdopodobieństwa, nazywamy punktami skoku.
Więc punktami skokowymi (skoku) są wszystkie możliwości wyrzutu oczek.
![]() | |
| Rys. Skumulowany rozkład zmiennej o tytule Rzut kostką (LJK). |
Na powyższym rysunku wygląda to tak, jakby wykres miał wartości jedynie w czarnych punktach a poza nimi nic nie było. Tak może być tylko i wyłącznie gdy rozmawiamy o skumulowanym prawdopodobieństwie w potocznym tego słowa znaczeniu, gdzie nie ma sensu rozmawiać o tym, ile ono wynosi w punkcie 3.5, bo nie można wyrzucić trzy-i-pół oczka.
Okazuje się, że różnica między skumulowanym prawdopodobieństwie a dystrybuantą jest taka, że dystrybuanta muruje dziury w wykresie skumulowanego prawdopodobieństwa: zobaczcie sami (niżej).
![]() |
| Rys. Dystrybuanta rozkładu zmiennej o tytule Rzut kostką (LJK). |
Różnica między dystrybuantą a skumulowanym prawdopodobieństwem
Dystrybuanta jako pojęcie matematyczne to nieco szersza sprawa niż skumulowane prawdopodobieństwo. Żąda się bowiem, aby dystrybuanta, oznacza zwykle: F (x), była określona dla wszystkich liczb rzeczywistych, czyli dla wszystkch x ∈ R, nawet jeśli cecha nie pokrywa wszystkich liczb rzeczywistych (np. nie można wyrzucić trzy i pół oczka, nikt nie ma ujemnej samooceny).
Z tej przyczyny powstaje pozorny problem - co z takimi wartościami dystrybuanty, których cecha nie przyjmuje? Nie ma problemu :)
Dla wartości wyższych niż maksymalny poziom cechy - dla nich skumulowane prawdopodobieństwo będzie równe 1. Ponadto, nawet jeśli cecha nie przyjmuje jakiejś wartości, to może mieć wartości z jakiegoś mniejszego zakresu, np.:
z tego powodu, że cecha nie przyjmuje wartości z przedziału (3, 3.5) - ale przyjmuje wartości do 3 - w związku zachowujemy się tak, jakby pytano o liczbę oczek do trzech, zamiast trzy i pół.P(X < 3.5) = P(X < 3)
Wygląda na to, że prawdopodobieństwo przyjęcia wartości z przedziału od ponad 3 do 3.5 jest równe zero, czyli P(3 < X < 3.5) = 0. Stawiamy zerowe prawdopodobieństwo tam, gdzie cecha nie przyjmuje takiej wartości.
Dodatkowo, skoro żadne prawdopodobieństwo nie jest ujemne, to cokolwiek dodawane do całości kumulacji wywoła powiększenie tej sumy - nigdy jej nie zmniejszy.Innymi słowami, kumulacja można pozostawać na stałym poziomie, ale nigdy nie może się zmniejszać. W ten sposób otrzymaliśmy trzy własności dystrybuanty - zapiszemy je formalnie.
Kryteria dystrybuanty - która funkcja jest dystrybuantą, a która nie jest?
Aby funkcja była dystrybuantą musi spełniać poniższe trzy kryteria:
1. dla x biegnących do minus ∞ F (x) = 0 oraz dla x biegnących do ∞ F (x) = 1, czyli:
2. prawostronnie ciągła
3. niemalejąca - czyli nie ma ujemnych prawdopodobieństw
To są formalne warunki dystrybuanty i nie będziemy się nad nimi specjalnie rozczulać.
Najciekawsze jest to, że jeśli narysujemy dowolną funkcję, lecz spełniającą powyższe kryteria to na pewno opisuje rozkład jakiejś zmiennej. Nie wiadomo, jaka i czy jest odkryta, ale już wiemy, że będzie to rozkład. Taki bajer :-)
Dystrybuanta teoretyczna a empiryczna.
W matematycznym depozycie znajdują się idealne rozkłady - między innymi normalny modelujący, wykładniczy, jednostajny i inne.
Dystrybuanta teoretyczna to dystrybuanta wynikająca z teorii matematycznej, można ją potraktować jako dystrybuantę cechy w (niedostępnej) populacji.
Ot, siedział jakiś człowiek na kartką papieru i mazał długopisem krzaczki i wyszedł mu wzór.Za to dystrybuanta empiryczna to dystrybuanta uzyskana na podstawie próby. To jest coś, z czym Ty masz do czynienia (i rozprawienia się) na kolokwium, egzaminie i w badaniach.
Dystrybuanta empiryczna - co to takiego?
To może spróbujmy zrozumieć jej mechanikę.
Niech x będzie dowolnym wynikiem zmiennej (cechy) - możliwym bądź nie. Po prostu: obserwacją. Wartość gdzie n to liczebność próby.
Wzór gwiazdka *
Na przykład: symbol Fˆ5(3) [ef z daszkiem] oznacza ile elementów jest mniejszych lub równych 3 w pięcioelementowej próbce.
Ok, po prostu chodzi o to, że liczymy ile elementów do tej wartości znalazło się w naszej próbie.
Dystrybuanta a gęstość.
Porównajmy teraz dwa widoki: dystrybuantę rozkładu standardowego normalnego N(0, 1) oraz gęstość rozkładu standardowego normalnego N(0, 1):
![]() |
| Rys. Dystrybuanta (po lewej) a gęstość (po prawej) rozkładu normalnego standardowego (LJK). |
Przykład.
Rzucaliśmy osiem razy kostką do gry - więc n = 8. Otrzymaliśmy takie wyniki: 3, 5, 2, 3, 2, 1, 4, 3. Ani razu szóstki, jedna jedynka, trzy trójki, jedna czwórka i jedna piątka.
Najpierw policzymy dystrybuantę dla tej sytuacji, to będzie dystrybuanta empiryczna. Korzystam ze wzoru oznaczonego gwiazdką (skrolnij wyżej).
Jak narysować dystrybuantę w tej sytuacji? Możemy mieć dystrybuantę empiryczną i teoretyczną. Wiemy, że skoro teoretycznie wszystkie wyniki są jednakowo prawdopodobne, to otrzymalibyśmy dystrybuanta teoretyczna. Z kolei dystrybuanta empiryczna odpowiada konkretnej sytuacji z zadania.
![]() |
| Rys. Dystrybuanta empiryczna i teoretyczna dla rzutu kostką (LJK). |
Widać, że się różnią. Mają różne 'progi'. Wyniki to z tego, że dystrybuanta teoretyczna odpowiada sytuacji idealnej, wszystkie rzuty są jednakowo prawdopodobne, stąd te punkty skoku są takie same. Po lewej mamy dystrybuantę empiryczną, która pokazuje, co się zdarzyło. A że bywa różnie, i mimo tego, że szanse na jakiekolwiek wynik są równe, to i tak w konkretnej sytuacji otrzymujemy różne wyniki.
Uwaga.
W matematyce istnieje coś takiego jak 'dystrybucja' (nie, nie dóbr jak w ekonomii) i nie ma to nic wspólnego z 'dystrybuantą'.
TL;DR Podsumowanie
1. Dystrybuanta to jeden ze sposobów na przedstawienie prawdopodobieństwa.
2. ...ale i tak wszyscy posługują się gęstością (czas, wzrost, zmienne ciągłe) lub funkcją prawdopodobieństwa (miejsce zamieszkania, rzut kostką, zmienne dyskretne)
Więc po co to? Wygląda na to, że po nic, ale...
3. w niektórych testach, np. w teście Kołomogorowa-Smirnova, przedmiotem badania są dystrybuanty, a nie gęstości, więc warto zawczasu poznać to pojęcie.
Centralne Twierdzenie Graniczne
2017| UPDATE: MAJ 2022| LJK | ~2500 słów
DO CZEGO SŁUŻY CENTRALNE TWIERDZENIE GRANICZNE – Co to jest za twierdzenie, jaki jest jego wzór i do czego służy? Jaki ma związek z rozkładem normalnym? W tym poście dowiesz się jakie są korzyści z jego stosowania, a jest to jedno z najważniejszych twierdzeń w statystyce. To twierdzenie służy do dwóch rzeczy: (1) rozluźnieniu założeń niektórych testów statystycznych (chodzi o wymogi, jakie muszą spełniać dane zanim zastosuje się wybrany test); (2) wyjaśnieniu, dlaczego wielu zjawisk, może mieć rozkład normalny.
JAK CTG DZIAŁA? - Proces Centralnego Twierdzenia Granicznego można porównać do stopniowego zanurzania się w abstrakcję – od wejścia po kostki aż po czubek głowy. Całość zaczyna się prosto, potem krok po kroku robi się coraz bardziej abstrakcyjnie i nagle kończymy po drugiej stronie lustra w bardzo abstrakcyjnym świecie, gdzie to, co empiryczne to odbicie prawideł istniejących w teorii.
KROK PIERWSZY #zero abstrakcji – właśnie przeprowadziłaś lub przeprowadziłeś badanie, w którym wzięło udział pięć osób (n = 5). Twoje badanie jest bardzo proste: mierzy czas reakcji motorycznej po usłyszeniu sygnału dźwiękowego – polega na wciśnięciu przycisku, gdy badany usłyszy sygnał dźwiękowy.
Wyniki pięciu osób badanych to: 0,47 s (sekundy); 0,28 s; 0,58 ms; 0,11 s i 0,52 s. Jeśli przedstawimy zebrane wyniki, to pokaże się wykres przedstawiający częstości poszczególnych wyników (histogram):
Tutaj na razie jesteśmy na suchym konkrecie: mamy badanie i konkretną średnią arytmetyczną pięciu wyników równą 0, 39 sekundy.
W DRUGIM KROKU #po kostki w abstrakcję - wyobrażamy sobie, że jest inny badacz, który wykonał to samo badanie. Również przebadał również pięć osób (n = 5 osób), ale otrzymał inne wyniki: 0,46 s; 1,3s; 0,53 s; 1,32 s; 0,96 s. Ten inny badacz również może wykonać histogram:
W TRZECIM KROKU #prawie w abstrakcji — Wyobraź sobie teraz, że istnieją tysiące badaczy, którzy wykonali dokładnie to samo badanie. Co tam tysiące - Miliony! Milion badaczy to milion średnich arytmetycznych tej samej zmiennej. Każdy z nich oblicza średnią arytmetyczną dla pięciu pomiarów czasów reakcji i - tutaj trik - wykonują histogram policzonych średnich arytmetycznych.
Ten rozkład tutaj to tzw. próbkowy rozkład średnich (sampling distribution of mean) dla prób wielkości n = 5. To rozkład statystyki opisowej, jaką jest średnia z próby - nie: pomiarów czasu reakcji. Nie jest on (jeszcze) normalny, ponieważ jest niesymetryczny - ma dłuższy ogon z prawej strony. Obok nazwy próbkowy rozkład średnich funkcjonuje też inna nazwa: rozkład z próby – traktuj je jak synonimy.
KROK CZWARTY #w abstrakcję po czubek głowy – zwiększymy liczbę osób badanych, z n = 5 na n = 30 i powtarzamy całą procedurę. Przeprowadzamy badanie z udziałem n = 30 osób i obliczamy średnią arytmetyczną. Wynosi ona 0,72 ms a histogram dla trzydziestu pomiarów czasu reakcji przedstawia się następująco:
W KROKU PIĄTYM #po drugiej stronie lustra... — Jeśli milion badaczy powtórzy nasze badanie z pomiarem Czasu reakcji dla n = 30 osób, to wówczas histogram będzie wyglądał jak ten poniższy.
Ten rozkład średnich jest całkiem podobny do rozkładu normalnego. Czarna linia naniesiona na histogram to właśnie linia krzywej Gaussa. Wszystko dzieje się zgodnie z Centralnym Twierdzeniem Granicznym - im więcej osób wchodzi do badania, tym szybciej rozkład średnich przypomina rozkład normalny.
Jak już powiedzieliśmy, histogram średnich dużej liczby badań będzie wyglądał na zbliżony do normalnego. Bęzie on zbliżać się do rozkładu normalnego właśnie na mocy Centralnego Twierdzenia Granicznego. Wkrótce przekonamy się, że parametry tego nowego rozkładu to średnia μ równa średniej z populacji (akurat tutaj to jest 1 w naszym przykładzie z czasem pomiaru), zaś odchylenie standardowe s to 1/sqrt(30).
Histogram zbliża się ku rozkładu normalnego wraz z rosnącą liczebnością prób. Profesjonalnie mówiąc, według CTG próbkowy rozkład średnich (sampling distribution of mean) zbiega do rozkładu normalnego wraz z rosnącą liczebnością próby. To znaczy: wykres przedstawiający częstości staje się coraz bardziej zbliżony do krzywej dzwonowej.
WZÓR NA CTG – Lepszą nazwą niż wzór będzie: zapis symboliczny. To dlatego, że nic nie podstawiamy do wzoru. Zapis symboliczny jest postaci:
Ten zapis jest jednym z prostszych sposobów, na jakie wyraża się Centralne Twierdzenie Graniczne, a to dlatego, że tak naprawdę jest to grupa twierdzeń, które mówią o zachowaniu się pewnych zmiennych losowych.
DLACZEGO GRANICZNE? — Powód, dla którego w nazwie CTG jest słowo:”graniczne” bierze się stąd, że pełna normalność rozkładu średnich dzieje się w nieskończoności. Dopiero, gdy mając próbę o nieskończonej liczbie osób badanych – zanurzyliśmy się już po czubek głowy w abstrakcji – rozkład średnich będzie rozkładem normalnym. Tą granicą jest tutaj nieskończoność - abstrakcyjna kraina, do której zbliżamy się wraz z rosnącą liczbą badanych, ale której nigdy nie osiągamy.
ROZKŁAD BADANEJ CECHY A ROZKŁAD ŚREDNICH BADANEJ CECHY — W CTG chodzi o rozkład średnich badanej cechy, a nie o rozkład samej cechy. Czym innym jest rozkład wartości badanej zmiennej, a czym innym rozkład średnich (arytmetycznych) badanej zmiennej. Jedno słowo – „średnich” – ma tutaj ogromne znaczenie. Rozkład badanej cechy w zebranej próbie zobaczysz na własne oczy (jest to np. owe pięć pomiarów). Rozkładu średnich badanej cechy nie da się zobaczyć – to abstrakcyjny twór.
Okazuje się, że są trzy rozkłady:
- rozkład teoretyczny zmiennej w populacji [górny rysunek] - zwykle nie jest znany
- rozkład, który opisuje wyniki w przeprowadzonym badaniu (tzw. rozkład empiryczny) [środkowy rysunek] - to histogram wyników
- rozkład średnich dla pewnej liczby innych badań o tej samej liczebności co Twoja [dolny rysunek] - ma się on stawać coraz bardziej podobny do rozkładu normalnego
JAK POPLĄTAĆ CTG? - Jak już powiedzieliśmy, Centralne Twierdzenie Graniczne mówi o rozkładzie średnich Twojej cechy, a nie o rozkładzie Twojej cechy. To jedno słowo, a robi różnicę. Tymczasem w tekstach można spotkać następujące stwierdzenie: Zgodnie z Centralnym Twierdzeniem Granicznym, zwiększając liczebność badanej próby, zwiększamy też prawdopodobieństwo uzyskania rozkładu normalnego naszych danych.
Zastanówmy się, jak mogłoby to miało wyglądać w praktyce? Powiedzmy, że w pewnym badaniu (np. n = 15) mierzono czas wykonania prostego zadania manualnego. Proste zadanie manualne, jak sama nazwa wskazuje, oznacza, że łatwo je zrobić. Nic więc dziwnego, że większość osób kończy wcześniej, zaś niewiele osób potrzebuje więcej czasu. Typowy wykres przedstawiający taką sytuację wygląda następująco (rysunek po lewej stronie):
Gdyby cytowane wyżej stwierdzenie było prawdziwe, to po przebadaniu większej liczby osób (np. n = 30), zmieniłby się rozkład wyników czasu reakcji. Zupełnie tak, jakby dochodzące osoby badane zmieniały charakter zjawiska - rysunek po prawej stronie.
Oczywiście, nie jest tak, że rozkłady cech się w ogóle nie zmieniają, ale ma na to wpływ chociażby czas – w sensie epoka – a nie liczebność próby w pojedynczym badaniu.
Zwiększając liczebności próby można co najwyżej wyostrzyć rozkład wyjściowej cechy – sprawdzić, że histogram jest łatwiejszy do rozpoznania - ale nie: zmienić go.
PARAMETRY ROZKŁADU PRÓBKOWEGO ŚREDNIEJ Z PRÓBY #tego rozkładu, który w dużych próbach ma być normalny
Niezależnie od tego, czy nasze dane posiadają rozkład normalny, możesz dla takich danych policzyć średnią arytmetyczną x z kreseczką oraz odchylenie standardowe. Wzory na obliczanie działają zawsze. Do tych dwóch obiektów będziemy się zaraz odwoływać.
Jeśli CTG twierdzi, że jakiś abstrakcyjny twór będzie miał rozkład normalny, to należy zadać pytanie – z jakimi parametrami? Wiadomo, że każdy rozkład normalny posiada dwa parametry – wartość oczekiwaną, zwaną też średnią (μ) oraz odchylenie standardowe (sigma, σ), a zatem musimy je znaleźć. Parametrem odpowiadającym średniej jest nasza teoretyczna średnia μ – ta z populacji. To sugeruje, że zwiększając liczebność próby, próbkowa średnia arytmetyczna x̄ leży coraz bliżej prawdziwej średniej teoretycznej μ.
Drugi parametr dla każdego rozkładu normalnego to (ogólnie) odchylenie standardowe. Omawiamy jednak coś innego niż zwykły rozkład wyników – w przypadku rozkładu średnich owe odchylenie standardowe to tzw. błąd standardowy średniej. Nie jest on równoznaczny z odchylenie standardowym w zebranej próbie (które wówczas oznaczamy s), ale znajduje się całkiem blisko – odchylenie standardowe wyników w próbie (owe s) musi zostać podzielone przez pierwiastek z liczebność próby n. W przypadku przykładu z n = 5 osobami, należałoby podzielić przez właśnie pierwiastek z 5. Błąd standardowy średniej jest odwrotnie proporcjonalny do liczebności próby. Im większa próba, tym większy mianownik, a błąd standardowy średniej robi się mniejszy. Ten drugi parametr sugeruje, że zwiększanie liczby osób badanych działa – im więcej osób badanych przebadasz, tym bardziej zmniejszasz błąd próbkowania (sampling error).
BŁĄD PRÓBKOWANIA – DLACZEGO NIE WYNOSI ZERO?
Błąd próbkowania to różnica między Twoją statystyką opisową policzoną w zebranej próbie a teoretycznym parametrem, o którym krótko mówi się: parametrem w populacji. Na przykład, niech to będzie różnica między średnią arytmetyczną w badaniu, np. 170,2 cm a średnią w populacji, czyli 170 cm. Te 2 milimetry to właśnie błąd próbkowania.
Fajnie byłoby, aby wynosił zero, ale nie możemy tego oczekiwać w świecie losowych zjawisk. Zupełnie tak, jak nie możemy oczekiwać, że grając w rzutki zawsze będziemy trafiać w samą 10-tkę. Ale w miarę, jak będziemy rzucać, to powinniśmy średnio być coraz bliżej.
Błąd standardowy średniej mówi o tym, jak bardzo średnie będą się różnić między sobą w różnych próbach. Na szczęście nie musimy szukać wszystkich prób, liczyć na nich średnie arytmetyczne, aby w końcu policzyć odchylenie standardowe między nimi, ale wystarczy wziąć odchylenie standardowe w naszej próbie i podzielić przez pierwiastek z liczebności.
Jeśli w przykładowym badaniu wzięło udział n = 5 osób, należy podzielić odchylenie standardowe s przez pierwiastek z 5.
KORZYŚCI ZE STOSOWANIA CTG — polegają na możliwości wykorzystania jego mocy w przypadku nie-normalnych rozkładów albo w przypadku nieznanych rozkładów. Centralne Twierdzenie Graniczne pomaga nam uniknąć poszukiwań rozkładu cechy w populacji i stosować testy statystyczne tak, jakby badana cecha miała rozkład normalny w populacji. Krótko mówiąc: CTG pozwala machnąć ręką na to, jak naprawdę wygląda rozkład cechy w populacji. Obok tego, dzięki CTG wiemy, że średnia arytmetyczna z naszych badań będzie coraz bliżej prawdziwego parametru populacji leżeć, im więcej osób zostanie przebadanych.
DLA JAKICH ROZKŁADÓW DZIAŁA CTG? - Dla wszystkich rozkładów, nie tylko dla normalnych. Dla takich cech, które dobrze opisuje coś innego, niż tylko krzywa Gaussa, np. czas reakcji, który bywa modelowany przez rozkład wykładniczy.
Dla rozkładu normalnego twierdzenie CTG jest niepotrzebne. Matematyk powiedziałby, że jest ono zbyt słabe dla takich zmiennych. Gdy wyjściowa cecha ma rozkład normalny, to rozkład próbkowy średniej będzie rozkładem normalnego ze względu na to, że sumowanie wartości zmiennej, których szansami występowania rządzi rozkład normalny, powoduje, że owa suma ma również rozkład normalny (Da się to powiedzieć krócej: sumowanie rozkładów normalnych nie wyprowadza wyniku poza rodzinę rozkładów normalnych).
OD ILU OBSERWACJI N MOŻNA PRZYJĄĆ, ŻE CTG DZIAŁA? - To jest największe pytanie, niestety, na które nie ma dobrej, jednoznacznej odpowiedzi. Podręczniki podają różne wartości, np. King, Rosopa i Minium piszą o tym, że już od 25-30, Howell podaje 30. Najczęściej podawaną wartością jest 30. Zgodnie z tym, gdy Twoja próba posiada n = 30 obserwacji (osób badanych, zwierzaków, śrubek), wówczas możesz bezpiecznie przyjąć, że Centralne Twierdzenie Graniczne już działa. Ta reguła mówiąc o n = 30 bywa kwestionowana, więc co możemy powiedzieć na pewno?
Można powiedzieć, że rozkłady symetryczne, o lżejszych ogonach (czyli takie bez outlierów, a szansach pojawiania się outlierów nie większych niż szanse w rozkładzie normalnym) są rozkładami, które szybko powodują zadziałanie CTG. Wiemy, też że dużym problemem jest kurtoza.
CZY MOŻNA SPRAWDZIĆ, CZY MOŻNA JUŻ STOSOWAĆ CTG? — Tutaj mam złą wiadomość, zwłaszcza jeśli cierpisz na testozę (tj. stosowanie testów statystycznych do wszystkich problemów). Nie istnieje test statystyczny sprawdzający, czy Centralne Twierdzenie Graniczne już działa – czy może jeszcze nie (i ile osób trzeba dobadać). Brakuje testu o hipotezie zerowej mówiącej, że dany rozkład próbkowy rozkład średnich jest już rozkładem normalnym.
Tutaj samodzielnie uznajesz, że masz wystarczającą próbę do skorzystania z CTG, albo uznajesz, że jest ona za mała. Jaka liczebność próby jest wystarczająca? Otóż, stąd wzięła się reguła kciuka (jedna z wielu heurystyk w statystyce), że wystarczy, że n = 30. Czy to prawda? To zależy. Dla takich rozkładów, które nie są zbyt skośne i jednomodalne - tak (zobacz rysunek wyżej).
CTG ORAZ TESTY STATYSTYCZNE — Centralne Twierdzenie Graniczne pozwala rozluźnić założenia testów statystycznych opartych na średnich. Testy statystyczne wymagają, aby dane spełniały określone wymogi, zwane założeniami. Niektóre z tych wymogów dotyczą normalności rozkładu oryginalnej cechy. W takim wypadku CTG przychodzi z pomocą, choć niepewną. Już nie trzeba oczekiwać, żeby zjawisko miało rozkład normalny, ale wystarczy, aby liczebność zebranej próby była dostatecznie duża, aby zadziałało CTG. Niepewność pomocnego działania CTG polega na tym, że nie wiemy, jak duża próba jest wystarczająco duża. Wiemy, że wystarczy, aby próba była symetryczna i bez obserwacji odstających.
Bez symulacji komputerowych nie jesteśmy w stanie powiedzieć nic więcej.
Decyzja, czy już działa CTG, czy jeszcze nie, należy do osoby wykonującej analizy statystyczne. Nie ma żadnego testu istotności statystycznej, który klepnie zgodę na jego wykorzystanie.
Kiedy badacz zdecyduje się, że jego dane pozwalają na odwołanie się do CTG, może przeprowadzić wybrany test statystyczny bez konieczności spełnienia bardzo restrykcyjnego założenia o normalności rozkładu badanej cechy. Przy czym, nie chodzi o każdy test statystyczny, a tylko o takie, które odnoszą się do równości średnich. W gruncie rzeczy chodzi o testy t-Studenta oraz ANOVA (czyli dwa najczęściej wykonywane testy).
CTG WOKÓŁ NAS — Działanie zobaczyć własnoocznie - spójrz na jakiekolwiek schody. Na schodach w miarę upływu czasu odrysowują się ścieżki, jakimi przeszło wiele, wiele, wiele osób.
Image by Tama66 on PixabayCzęść osób idzie przy ścianie, część - trzymając się poręczy. Większość osób idzie zwykle środkiem schodków. Wydeptana powierzchnia schodów z czasem ukazuje się charakterystyczny wzorzec wyświecenia, który doskonale obrazuje uśrednioną wartość wydeptanych ścieżek i jednocześnie istotę Centralnego Twierdzenia Granicznego: im więcej osób wejdzie do Twojej próby, tym szybciej zobaczysz gaussowski kształt rozkładu średnich.
CTG UZASADNIA, DLACZEGO TAK WIELE CECH MOŻE UCHODZIĆ ZA NORMALNE? — Mówi się, że rozkład normalny odzwierciedla naturę wielu zjawisk: obwód jabłka, wzrost człowieka, długość palców, itd. Obecnie wiemy już, że oprócz rozkładu normalnego istnieją również inne rozkłady (a cała ich lista znajduje się na Wikipedii). Dlaczego jednak tak długo uczeni wierzyli, że pojawianiem się różnych wyników w obrębie wielu cech rządzi krzywa Gaussa?
Aby to zrozumieć, wystarczy tylko nieco inaczej spojrzeć na samą średnią. Weźmy – wzrost człowieka. Jest to zmienna, na którą wpływa wiele rzeczy: geny, środowisko, przebyte choroby, aktywność fizyczna. Wpływ tych czynników sumuje się i sprawia, że dana osoba mierzy 1,75 cm. I wówczas wkracza Centralne Twierdzenie Graniczne. Mówi ono, że jeśli cecha jest wypadkową wielu innych zjawisk, to przejawy tej cechy będą występować zgodnie z rozkładem normalnym. To dlatego w naturze wiele zjawisk wygląda tak, jakby miało rozkład normalny.
Rozkład normalny
SPIS TREŚCI:
|
WYKRES
Kiedy zaczynasz swoją przygodę z rozkładem normalnym, to pierwsze co zobaczysz na wykresie to wybrzuszająca się ku górze linia. Dość często na rysunkach przyjmuje ona kształt dzwonu, stąd rozkład normalny bywa nazywany rozkładem dzwonowym (the bell curve). To bywa mylące, podziałka na osi poziomej daje się sterować tak, że kształt dzwonu będzie bardzo rozciągnięty, niemalże spłaszczony, albo mocno wyciągnięty, niemalże iglicowy. W obu przypadkach trudno będzie dostrzec dzwon. Zobaczysz to na jednym z niżej umieszczonych rysunków.
Wybrzuszenie znajduje się w szczególnym miejscu, czy górka, oznacza, że średnia znajduje się na samym szczycie krzywej. Matematyk powie, że maksymalizuje funkcję rozkładu. Niestety, nie powie, że średnia ma największe prawdopodobieństwo wystąpienia z pewnego matematycznego powodu. Otóż, w matematyce umówiliśmy się, że jeśli mamy rozkłady ciągłe, rysowane bez odrywania ręki od kartki, to wówczas nie można policzyć prawdopodobieństwa pojedynczej liczby. Nazywamy je wówczas gęstościami. Za to możemy powiedzieć, że prawdopodobieństwo koncentruje się wokół średniej. Taki wykres nazywamy gęstością KLIK
Na
wyrysowanie tej krzywej jest konkretny przepis, zwany wzorem funkcji.
Ta funkcja jest nieco bardziej skomplikowana niż te, które widujemy
w szkole, ale jeśli ktoś miał w rozszerzeniu liczbę e, to będzie
mu łatwiej. Liczba e to specjalna liczba, podobnie jak pi nie ma
okresu. Pierwsze trzy cyfry to 2,71. Reszta jest przedmiotem odkryć matematyków.
Więc jeśli zobaczysz taki wzory e2 albo f(x) = ex, to będziesz wiedzieć, że
w pierwszym przypadku 2,71 podniesiono do kwadratu, zaś w drugim
mamy funkcję, która każdemu x przyporządkowuje potęgę liczby e,
f(1) = e (więc, f(1) to po prostu 2,17), f(2) = e2, itd.
Po tym małym galopie przez lekcję z matematyki, jesteśmy gotowi zobaczyć wzór na gęstość rozkładu normalnego. Wprawdzie nigdzie się go nie używa manualnie, ponieważ mamy komputery, które wszystko liczą, ale warto choć raz w życiu oddać się kontemplacji. Wzór wygląda tak:
Jest nieco bogatszy w symbole niż poprzednio omawiane przykłady, ale działa zupełnie tak samo. Iksy są argumentami, igreki są wartościami funkcji, ale wprost ich nie napisano. Dobrze pamiętać, że teraz iksy to wartości cechy, zaś wartości funkcji to po prostu ta gęstość. Ponieważ nie możemy sobie podstawić pojedynczej wartości cechy do wzoru, aby policzyć szansę jej wystąpienia, to, co robi się, to liczy się szanse na wybrany zakres wartości. To jest to, co mówi ortodoksyjna matematyka.
Powyższy
wzór jest wzorem na gęstość pewnego szczególnego rozkładu normalnego, tzw. standardowego rozkładu normalnego. Zapisuje się go:
N(0,1). W ten sposób osoba komunikuje, że szczyt jej wykresu znajduje się w zerze na osi poziomej, zaś symetrycznie w punktach -1 i 1 na tej samej osi poziomej znajdują się punkty, wymuszające charakterystyczne zachowanie tej krzywej.
Otóż, gdybyśmy puścili lawinę ze szczytu, czy to z jego lewej, czy z prawej strony, wówczas około -1 i 1 zaczęłaby ona
wyhamowywać. To oczywiście dla psychologa jest ciekawostka, natomiast dla matematyka i fizyka nazywa się punktem przegięcia
krzywej. Wszyscy razem nazwą to miejsce odchyleniem standardowym. Praktycznie rzecz biorąc, od tych dwóch punktów prawdopodobieństwo obserwacji leżących dalej od szczytu zaczyna drastycznie spadać. To właśnie zjawisko będzie odpowiedzialne za to, dlaczego reguła 3 sigma wygląda, jak wygląda.
JEDEN WZÓR, WIELE WYKRESÓW
Skoro ten rozkład standardowy
normalny szczególny przypadek, to pewnie jest reszta nie-szczególnych przypadków.
I w ten sposób dowiadujemy się, że tak naprawdę rozkład normalny tworzy rodzinę rozkładów normalnych, to znaczy takich krzywych,
które posiadają pewne wspólne właściwości, choć umieszczone na wykresie mogą
się od siebie różnić.
Coś podobnego było w liceum, bo był tzw. ogólny wzór na daną funkcję. Na przykład ogólny wzór na funkcję liniową jest f(x) = a*x+b, której wykresem jest prosta, gdzie a i b to liczby stałe. Jak się podstawiło pod a i b jakieś liczby, to otrzymywało się konkretną funkcję. I tak f(x) = x+1 to funkcja liniowa, podobnie jak f(x) = 5x+2 albo f(x) = -3*x+1. I z rozkładami normalnymi jest taka sama sytuacja. Jeden wzór jako parasol i nieskończona liczba konkretnych funkcji.
WŁASNOŚCI ROZKŁADU NORMALNEGO
1. SYMETRYCZNOŚĆ – technicznie rzecz biorąc, lewa strona rozkładu jest taka sama jak prawa. To oznacza, że częstość występowania obserwacji powyżej średniej jest taka sama, jak poniżej średniej. Sytuacja, jak dzieje się po jednej stronie rozkładu odpowiada sytuacji, jaka dzieje się po drugiej stronie. Rozkład normalny niezbyt dobrze opisuje sytuacje, w których jest więcej osób po jednej stronie średniej niż po drugiej.
2. JEDNOMODALNOŚĆ – jest jedna wartość dominująca (inna nazwa: unimodalny), jedna górka, która jest górką globalną, góruje – jak to mają górki – nad całym rozkładem. To gwarantuje, że jest jeden peleton, jedna grupa trzymająca władzę, zaś outsiderów jest coraz mniej. Rozkład normalny niezbyt dobrze opisuje sytuacje, gdy zjawisko ma dwie grupy.
3. ZEROWA SKOŚNOŚĆ – skośność rozkładu normalnego wynosi okrągłe zero a zerowa skośność oznacza symetryczność rozkładu. Patrz punkt pierwszy.
4. ZEROWA KURTOZA (eksces wynosi 0) – kurtoza odpowiada na pytanie o
występowanie wartości odstających.
Ale... czy rozkład normalny może
mieć wartości odstające? Odpowiedź
jest twierdząca. Wróćmy na chwilę do rysunku gęstości.
Zobaczcie, ta krzywa nigdzie nie dotyka poziomej linii OX. Skoro jej
nie dotyka, to oznacza to, że żadna wartość cechy nie ma zerowej
szansy na pojawienie się, więc teoretycznie każda wartość, nawet najbardziej oddalona od średniej, może
wystąpić, tylko te szanse nie są równe. Można powiedzieć, że rozkład normalny jest
ekskluzywny, ponieważ nie daje równych szans. Zasady ekskluzywności znajdują się w części
dotyczącej reguły trzech sigma.
Rozkład normalny w statystyce klasycznej jest tym, do którego porównuje się rozkłady, które pokażą się w badaniu (innymi słowami rozkłady empiryczne sprawdza się pod kątem normalności), dlatego to właśnie jego kurtoza jest tym wzornikiem. Zerowa kurtoza to nie jest brak obserwacji odstających.
Czy mogą pojawić się obserwacje odstające (outliery)?
W każdej społeczności są zwykli ludzie, są ci bardziej popularni, których nazwalibyśmy węzłami społecznymi, oraz ci mniej popularni outsiderzy i totalne freaki. Freaki, czyli wartości odstające mają prawo pojawić się w rozkładzie normalny – niezbyt często i im dalej od klubu, tym rzadziej, ale ważne jest to, że mają. Żadna wartość nie jest wyeliminowana. Skoro sukienka ducha nie sięga osi poziomej OX, to znaczy, że nikt nie ma zerowych szans na wystąpienie. Myślę, że problem wynika z przedstawiania wykresu normalnego na zajęcia i podręcznikach. Często te dalsze od szczytu części krzywej leżą płasko, że powstaje złudzenie, że pokrywają się z zerem.
Reguła trzech sigma
Rozkład normalny nie jest rozkładem równych szans a reguła, która mówi, kto należy do klubu, nazywa się regułą trzech sigma. W rozkładzie normalnym zachodzi taka właściwość: wprawdzie każda z obserwacji ma jakąś szansę wystąpienia, ale niektóre znajdują się w przedziale który bardzo często zdarza się, a inne niestety są outlierami. Co to znaczy? To znaczy, że obserwacje powyżej wartości równej średnia + 3*odchylenie standardowe (np. dla μ= 0 i σ=1 to jest powyżej 3) mają nikłe szanse wystąpienia (co nie znaczy, że zerowe). Zdecydowana większość obserwacji biega wokół średniej w odległości nie większej niż trzy odchylenia standardowe.
PRZYKŁAD — Średni wzrost dorosłego człowieka to mu = 177,8, a odchylenie standardowe wynosi 7,62 cm.
Wówczas μ + 3*σ = 177 +3*7,62 = 199,86 cm. mu – 3*sigma=154,14.
Zatem 99% ludzi dorosłych siedzi w przedziale [154,14; 199,86] i
bardzo trudno znaleźć kogoś wypadającego poza ten przedział. Co
nie znaczy, że nie ma ich w ogóle. Najniższy i najwyższy
zanotowany wzrost dorosłego człowieka na świecie wynoszą
odpowiednio: 73 cm i 272 cm.
DZIAŁANIE REGUŁY – Wróćmy na wykres gęstości rozkładu normalnego. Wiemy już, że mamy dwie liczby: mu
i sigma. Wykorzystamy je do wyjaśnienia działania tej reguły.
Umówmy się, że w mu wbijamy patyk o długości sigma i jak na piasku będziemy zataczać kręgi. Najpierw o promieniu patyka, czyli sigma. To jest pierwszy krąg. W jego obrębie znajdują się obserwacje, które zgarniają 68% szans wystąpienia. Następnie bierze się kij dwa razy dłuższy i zataczamy kolejny krąg. Wówczas mamy obserwacje, które zagarniają 95 % szans i regułę dwa sigma. A potem kij trzy razy dłuższy i zatoczywszy trzeci krąg, zgarniamy obserwacje o łącznie 99% szansach wystąpienia. To przejście między drugim a trzecim kręgiem jest mało spektakularne, z 95% na 99%. Tworzą one klub o nazwie trzech sigma. Reszta to już obserwacje, które mają małą szansę na pojawienie się, tacy outsiderzy.
Ta reguła działa tylko dla rozkładu normalnego. Rozkład normalny jest jednym z wielu znanych rozkładów, lecz jedynym dla którego reguła trzech sigma działa.
KWANTYLE RZĘDU 2,5 ORAZ 97,5
Skupmy się na miejscach, które są na styku drugiego i trzeciego kręgu. Te szczególne miejsca to kwantyle rzędu 2,5% i 97,5%. Rozkład normalny ma oczywiście wszystkie inne kwantyle, ale te akurat są wykorzystywane do budowy 95% przedziału ufności dla średniej. Co do wartości są one równe, różnią się znakami. Pomiędzy nimi znajduje się 95% całej masy rozkładu.
Warto pamiętać, że do przedziału ufności używamy kwantyli rozkładu normalnego, to sugerujemy, że dane zjawisko ma rozkład normalny. Więcej tu:KLIK (link prowadzi do posta o przedziale ufności dla średniej).
Imiona rozkładu normalnego
Rozkład normalny można nazwać jeszcze inaczej niż tylko rozkładem dzwonowym. Można nazwać go również od nazwisk odkrywców/twórców. Aby uhonorować wszystkich nazywając go rozkładem Moivre’a-Gaussa-Laplace’a. Każdy z tych siedemnastowiecznych i osiemnastowiecznych uczonych miał udział w odkrywaniu tego rozkładu. Nazwę rozkład normalny używamy mniej więcej sto lat i tylko dlatego, aby uniknąć sporów o palmę pierwszeństwa w odkryciu.
Czy rozkład normalny jest powszechny?
W powszechności rozkładu normalnego dzisiaj jest więcej legendy niż prawdy. Prawdą było pod koniec XIX wieku, kiedy mierzono i ważono wszystko, co się dało w obrębie ludzkiego ciała. Ciekawe, że większość z antropometrycznych badań bierze na warsztat rzeczy, które same w sobie składają się z wielu elementów.
Weźmy wzrost człowieka. To, jaki wzrost osiągnie człowiek, jest decydowane przez zarówno geny, jak i środowisko. Genetyczny wkład obojga rodziców, odżywianie, choroby w dzieciństwie, wypadki – wszystko to razem powoduje, że ktoś może narzekać na bycie gidią. Nie ma jednego czynnika decydującego o wzroście. Tak samo jak o długości palców, wadze itp. Takie zjawiska, które złożone są różnych puzzli, mają tendencję do wykazywania rozkładu normalnego w populacji, a za takie zabrano się w XIX wieku.
Przy okazji to jest główna myśl centralnego twierdzenia granicznego CTG: jeśli badane przez Ciebie zjawisko jest sumą pomniejszych, bardziej elementarnych, to uzyskasz obraz krzywej Gaussa.
Dzisiaj już wiemy, że rozkład normalny nie jest tak często spotykany, jakby wskazywała jego nazwa. jak jednorożce. Jego właściwości powodują, że nie istnieje takie zjawisko, do którego rozkład normalny pasowałby jak ulał. Ten rozkład jest rozkładem teoretycznym, modeluje zjawiska w rzeczywistości na tyle dobrze, że można często machnąć ręką na miejsca, w których odchodzi farba.
Dlaczego chcemy, aby zmienna miała rozkład normalny?
Psychologia stoi na statystyce klasycznej, zaś w statystyce klasycznej są dostępne testy, które powstawały w czasie, kiedy jeszcze nie było pomysłów, że mogą istnieć inne rozkłady. Te metody to np. test t-Studenta albo analiza wariancji. W psychologii często wykorzystujemy porównania między dwiema lub więcej grupami typu ANOVA. Są to nieco starsze metody, u których podstaw leżą założenia o normalności rozkładu zmiennej zależnej, czyli tej cechy. Wobec tego, wielu badaczy dokonuje operacji na swoich danych i transformuje dane tak, aby miały rozkład normalny. To założenie jest ogólnie bardzo mocne i to, co one potrzebują, to tak naprawdę normalności nieco gdzie indziej – potrzebujemy, aby rozkład średnich był normalny. Nam dość często będzie wystarczać to, żeby rozkład cechy był w miarę symetryczny i nie miał zbyt ciężkich ogonów.
Jak sprawdzić, czy zmienna ma rozkład normalny?
Są dwie drogi – poprzez naoczne sprawdzenie, czyli eksplorację danych oraz poprzez formalne testowanie testami statystycznymi. Albo można wybrać obydwie drogi. To nie jest tak, że jak wybierzesz jeden test, to nie możesz zajrzeć do statystyk opisowych.
Na eksplorację danych składają się statystyki opisowe, czyli liczby, oraz wizualizacja danych, czyli grafika. Formalne testowanie to wybór testów istotności statystycznej.
Statystyki opisowe
Aby cecha miała rozkład normalny musi mieć jego własności – jednomodalność, symetryczność (brak skośności), odpowiednia kurtozę. Sprawdź więc skośność i kurtozę - wiemy, że rozkład normalny ma zerową skośność i kurtozę. Oczywiście musimy przygotować się na jakąś losowość danych i wykazać elastycznością, więc musimy dopuścić jakieś niezerowe wartości skośności.
Reguły kciuka pozwalają machnąć ręką na pewien zakres jednych i drugich i uznać, że otrzymane wartości są podobne do teoretycznych właściwości rozkładu normalnego. Jak już widzieliśmy, skośność i kurtoza rozkładu normalnego wynosi zero. Jedną z popularniejszych reguł kciuka odnośnie skośności jest ta, która mówi, że skośność w próbie, które znajduje się między -1 a 1 to jest skośność, która nie powinna nas martwić. Dla kurtozy ten przedział wynosi między -2 a 2.
Wizualizacja danych
WYKRES SKRZYNKOWY – Ten wykres podsumowuje pięć charakterystyk zmiennej: mediana, zaznaczona czarną linią. Dolna i górna krawędź to pierwszy i trzeci kwartyl. Bok prostokąta to rozstęp międzykwartylowy. Wpływa on na długość antenek wystających z prostokąta zwanych wąsami. Wyznaczają one zakres takich wartości, które jeszcze mieszczą się w przedziale typowych wartości. To, co nie znajdzie się wewnątrz wąsów, będzie oznaczone jakąś figurą geometryczną (zależnie od programu). Więcej o wykresie skrzynkowym: TUTAJ
Zmienna, której szansami rządzi rozkład gaussowski ma odpowiedni wygląd boksplota. Spójrzmy na poniższy rysunek. Po lewej stronie znajduje się typowy wykres skrzynkowy zmiennej, która pochodzi z rozkładu normalnego. Po prawej stronie – takiej, która nie pochodzi z tego rozkładu. Boxplot zmiennej z rozkładu normalnego jest symetryczny, może mieć outliery, ale nie może ich być zbyt dużo. Boxplot po prawej stronie jest zupełnie inny. Wygląda jakby spływał po ścianie zostawiając po sobie outliery.
WYKRES KWANTYLOWY – Na wykresie kwantylowym zaznaczone są punkty, których współrzędne oznaczają teoretyczne kwantyle rozkładu normalnego oraz empiryczne kwantyle rozkładu badanej cechy.
W idealnej sytuacji, jeśli badany przez Ciebie rozkład jest rozkładem gaussowskim, to powinien pokazać się prosty sznurek z punktów ułożony na przekątnej rysunku. To dlatego, że empiryczne kwantyle zgadzają się w pełni z teoretycznymi. We wszystkich innych wystarczy, że mniej więcej znajdzie się na przekątnej. Po lewej stronie mamy zmienną z rozkładu normalnego. Po prawej stronie – zmienną z rozkładu innego niż normalny.
Testy normalności
Jest pięć popularnych testów istotności statystycznej dla testowania normalności rozkładu. W SPSS-ie są dwa z nich.
Dobrym testem jest test Shapiro – Wilka (w skrócie: S-W). Został bezpośrednio zaprojektowany do testowania hipotezy o normalności rozkładu. Test Shapiro-Wilka jest oparty na kwantylach – sprawdza, jak dobrze kwantyle rozkładu badanej cechy pokrywają się z kwantylami rozkładu normalnego. Coś podobnego robimy, oglądając wykres kwantylowy.
Znany jest też test Kołmogorowa-Smirnova (K-S). Wykorzystuje się do badania czy rozkład wynikający z próby jest rozkładem wynikającym z teorii, a nie zawsze teoria musi postulować normalność. Ze względu na to, że jest zaprojektowany na wiele innych sytuacji niż testowanie o normalności rozkładu, to w gruncie rzeczy test K-S dla zbadania rozkładu normalnego to test Lilieforsa.
Trzecim stosunkowo często wykorzystywanym testem normalności jest test Andersona-Darlinga. W zasadzie, powinien znaleźć się na drugim miejscu – przed testem K-S, ze względu na to, że jest od niego mocniejszy (w kontekście popełniania błędu I – go rodzaju). Niektórzy uważają go za równie dobry jak test Shapiro-Wilka, również w małych próbach.
Który z tych testów wybrać? W Internecie i podręcznikach znajdzie się sposób wyboru oparty na liczebnościach. Jedne źródła mówią, że SW jest do 2000 obserwacji, a od 2000 jest KS, albo jeszcze inaczej. Reguły kciuka mówią, dla jakich liczebności próby wybierać albo jeden, albo drugi test. Skoro test S-W ma na celu testowanie normalności, to warto wykorzystywać go dla mniejszych prób (od 15 do 50).
Te reguły liczebnościowe wywodzą się z doświadczenia, nie z dowodów matematycznych, co osłabia ich kategoryczność.
Moja rada jest taka: po pierwsze, możesz użyć kilku testów. Obejrzenie wartości statystyk testowych, zwłaszcza, gdy ma się doświadczenie, pozwala przyjrzeć się temu, co mówią dane. Po drugie wiesz na czym opierają się te testy, co mierzą. Test K-S lepiej sprawuje się przy dużo większych próbach (rzędu setek albo i tysięcy elementów).
DIY: Sprawdź sobie, czy Twoja zmienna jest normalna? (W SPSS-ie)
Wchodzimy kolejny w Analiza-> Opis Statystyczny -> Eksploracja.
To oczywiście tylko jeden ze sposobów sprawdzania.
Dalej otwiera się menu z poleceniami. Wybieramy zmienną do diagnostyki normalności i przenosimy ją w okienko z nazwą Zmienne zależne. Następnie klikamy w przycisk Wykresy.
Pojawia się trzyczęściowe okienko. Środkowa część zawiera checkbox z napisem "Wykresy normalności z testami". Jakie to testy? Nie wiadomo w tym momencie, ale zaznaczamy i klikamy Ok.








































