11 · Prawa i prawdy · 3 min czytania · Interaktywne · aktualizacja
Co mówi centralne twierdzenie graniczne i dlaczego rozkład normalny jest wszędzie?
W skrócie
Suma lub średnia wielu niezależnych wartości ma w przybliżeniu rozkład normalny, nawet gdy pojedyncze wartości są skrajnie skośne. Skąd to się bierze.
Co to jest
Średnia (lub suma) wielu niezależnych zmiennych losowych o skończonej wariancji ma w przybliżeniu rozkład normalny o odchyleniu standardowym σ/√n — niezależnie od tego, jak wygląda rozkład pojedynczej zmiennej. Przypadek monety opisał Abraham de Moivre w „The Doctrine of Chances” (wyd. 2, 1738), a ogólną wersję podał Pierre-Simon Laplace w 1810 roku.
To wyjaśnia, dlaczego krzywa dzwonowa pojawia się tak często: wzrost, błąd pomiaru czy wynik testu to efekt sumy wielu drobnych, niezależnych wpływów. Wyjaśnia też, dlaczego przedziały ufności i testy statystyczne działają na danych, które same w sobie normalne nie są.
Twierdzenie nie mówi, że dane są normalne. Mówi, że normalna jest średnia z próbki, gdy próbka jest dostatecznie duża.
Mechanizm — dlaczego tak działa
Intuicja: gdy dodajesz wiele niezależnych składników, ich kształty „rozmywają się”. Skośność jednego składnika jest częściowo kompensowana przez inne, bo skrajne wartości rzadko trafiają się wszystkie naraz. Każde dodawanie zmiennych losowych to splot rozkładów, a powtarzany splot wygładza dowolny kształt w stronę dzwonu.
Formalnie: rozkład normalny jest jedynym (o skończonej wariancji) rozkładem stabilnym na dodawanie — suma dwóch zmiennych normalnych jest znowu normalna, z tym samym kształtem. To punkt stały, do którego „ściąga” uśrednianie. W dowodzie przez funkcje charakterystyczne wszystkie wyższe momenty (skośność, kurtoza) znikają w granicy, zostaje tylko średnia i wariancja.
Liczby, które warto znać: skośność średniej z n obserwacji maleje jak 1/√n. Rozkład o skośności 2 (wykładniczy) po uśrednieniu 30 wartości ma skośność około 0,37 — już prawie symetryczny. Rozkład o skośności 5 potrzebuje dużo większych próbek.
Zastrzeżenia. Potrzebna jest skończona wariancja: dla rozkładu Cauchy’ego średnia nigdy nie staje się normalna. Potrzebna jest niezależność (lub słaba zależność). Przybliżenie jest najgorsze w ogonach — prawdopodobieństwa skrajnych zdarzeń szacowane z rozkładu normalnego bywają mylące nawet dla dużych n. Popularna reguła „n ≥ 30 wystarczy” nie jest prawem, tylko heurystyką dla umiarkowanie skośnych danych.
Na przykładzie
Ceny biletów na Titanicu (891 pasażerów) są skrajnie skośne: średnia 32,2 funta, mediana 14,5 funta, skośność 4,78. Losujemy 10 000 razy po 50 biletów (ze zwracaniem, ziarno 7) i liczymy średnią każdej próbki. Rozkład średnich ma odchylenie standardowe 7,00 — teoria σ/√n daje 7,02 — a skośność spada z 4,78 do 0,67. W przedziale ±1,96 błędu standardowego wokół prawdziwej średniej leży 95,5% średnich, prawie dokładnie zapowiadane 95%.
Ten sam eksperyment na rozkładzie wykładniczym (średnia 1, skośność 2, ziarno 7): skośność średnich wynosi 2,0 dla n = 1, 1,45 dla n = 2, 0,91 dla n = 5, 0,36 dla n = 30 i 0,22 dla n = 100. Odchylenia standardowe średnich (0,70; 0,45; 0,18; 0,099) zgadzają się z 1/√n z dokładnością do setnych.
Dane: Titanic
W praktyce
- Błąd standardowy średniej:
x.std(ddof=1) / np.sqrt(len(x)); 95% przedział ufności to średnia ± 1,96 × błąd standardowy (w kodziescipy.stats.norm.ppf(0.975)). - Dla małych próbek używaj rozkładu t:
scipy.stats.t.interval(0.95, df=n-1, loc=m, scale=se). - Przy bardzo skośnych danych lub nietypowych statystykach (mediana, AUC, F1) zamiast wzoru użyj bootstrapu —
scipy.stats.bootstrap. - Różnicę dokładności dwóch modeli na tym samym zbiorze testowym oceniaj na różnicach per przykład, nie na dwóch osobnych przedziałach.
- Sprawdzaj kształt średnich symulacją (
np.random.default_rng) zamiast wierzyć regule „n = 30”. - Typowy błąd: wniosek „dane są normalne, bo działa CLT”. CLT dotyczy średnich, nie pojedynczych obserwacji; reszty modelu i wartości odstające trzeba oglądać osobno.
Najczęstsze pytania
- Czy CLT oznacza, że moje dane mają rozkład normalny?
- Nie. Dane mogą być dowolnie skośne. Normalny staje się dopiero rozkład średniej (lub sumy) liczonej z wielu niezależnych obserwacji.
- Od jakiego n działa centralne twierdzenie graniczne?
- Zależy od skośności i ogonów rozkładu. Dla symetrycznych danych wystarczy kilka obserwacji, dla wykładniczych około 30, dla cen czy dochodów bywa potrzebne kilkaset. Najpewniej sprawdzić to symulacją lub bootstrapem.
- Jak CLT wiąże się z uczeniem maszynowym?
- Uzasadnia przedziały ufności dla metryk na zbiorze testowym, tłumaczy, dlaczego szum gradientu z mini-batcha jest w przybliżeniu normalny, i stoi za wieloma testami porównującymi modele.
Źródła
- Abraham de Moivre, „The Doctrine of Chances”, wyd. 2, Londyn 1738.
- Pierre-Simon Laplace, memoriał o przybliżeniach funkcji bardzo dużych liczb, Mémoires de l’Académie des sciences, Paryż 1810.
- Charles M. Grinstead, J. Laurie Snell, „Introduction to Probability”, American Mathematical Society, 1997, rozdz. 9 (Central Limit Theorem).
- Larry Wasserman, „All of Statistics”, Springer, 2004, rozdz. 5 (Convergence of Random Variables).