11 · Prawa i prawdy · 3 min czytania · aktualizacja
Co to jest prawo małych liczb i dlaczego małe próbki dają skrajne wyniki?
W skrócie
Ludzie oczekują, że mała próbka będzie wiernym obrazem populacji. Tymczasem małe próbki częściej dają skrajne wyniki, z których wyciągamy fałszywe wnioski.
Co to jest
Ludzie błędnie zakładają, że nawet mała próbka będzie wiernie odzwierciedlać populację, jakby prawo wielkich liczb działało także dla małych liczb. Nazwę i opis tego błędu podali Amos Tversky i Daniel Kahneman w 1971 roku w artykule „Belief in the law of small numbers”, badając… zawodowych psychologów i statystyków.
To nie jest prawo przyrody, tylko prawo ludzkiej intuicji — i to błędnej. Prawdziwe prawo brzmi odwrotnie: małe próbki są bardzo zmienne, więc najwyższe i najniższe wyniki niemal zawsze pochodzą z najmniejszych grup. Najlepsze szkoły w rankingu, najzdrowsze powiaty, najbardziej „skuteczne” warianty strony po dziesięciu kliknięciach — często są po prostu małe.
Skutek w nauce: badacze planowali za małe eksperymenty, ufali wynikom z pilotażu i dziwili się, gdy replikacja nie wychodziła. Skutek w ML: wnioski z małego zbioru walidacyjnego, który przypadkiem sprzyja jednemu modelowi.
Mechanizm — dlaczego tak działa
Odchylenie standardowe średniej z próbki to σ/√n. Przy 15 obserwacjach jest ono prawie dwa razy większe niż przy 45 i ponad osiem razy większe niż przy 1000. Jeśli wiele grup ma ten sam prawdziwy poziom, a różnią się tylko liczebnością, to małe grupy rozrzucą się szeroko, a duże skupią się blisko prawdziwej wartości. Skrajne pozycje w rankingu przypadną więc małym grupom, w obu kierunkach.
Howard Wainer nazwał wzór σ/√n „najniebezpieczniejszym równaniem”, bo jego ignorowanie prowadziło do kosztownych decyzji — np. do promowania małych szkół, bo to one dominowały w czołówce rankingów (dominowały też na samym dole, czego nikt nie oglądał).
Dlaczego intuicja zawodzi? Według Tverskyego i Kahnemana działa heurystyka reprezentatywności: oczekujemy, że próbka „wygląda jak” populacja, łącznie z lokalną losowością. Stąd wiara, że po serii orłów powinna wypaść reszka, i zaskoczenie, gdy w małej próbce wychodzą długie serie. Mózg ocenia proporcję, a ignoruje liczbę obserwacji, z której ta proporcja pochodzi.
Zastrzeżenie: nie chodzi o to, że małe próbki są bezużyteczne. Chodzi o to, że trzeba z nimi podawać niepewność (przedział ufności) i nie porównywać surowych proporcji między grupami o bardzo różnej liczebności.
Na przykładzie
Zadanie ze szpitalami (Tversky i Kahneman, 1974): w dużym szpitalu rodzi się 45 dzieci dziennie, w małym 15. Który szpital zanotuje w roku więcej dni, w których ponad 60% noworodków to chłopcy? Większość ludzi odpowiada „mniej więcej tyle samo”. Rachunek dwumianowy daje średnio 55 takich dni w małym szpitalu i 25 w dużym. Symulacja jednego roku (numpy, default_rng(3)) dała 53 dni w małym i 20 w dużym.
Ranking szkół (default_rng(5)): 1000 szkół o liczebności od 10 do 499 uczniów, wszystkie z identycznym prawdziwym poziomem; każdy uczeń dostaje losowy wynik, szkoła — średnią. Szkoły poniżej 100 uczniów to 17,9% wszystkich. W pierwszej pięćdziesiątce rankingu stanowią 60%, a w ostatniej pięćdziesiątce — 80%. Mediana liczebności to 246 uczniów w całej grupie, 84 w czołówce i 42 na dole.
W praktyce
- Do każdej proporcji podawaj przedział ufności, np.
statsmodels.stats.proportion.proportion_confint; „3 z 4” i „750 z 1000” to nie ta sama informacja. - Rankingi grup o różnej liczebności wygładzaj w stronę średniej ogólnej (estymacja bayesowska, shrinkage) zamiast sortować surowe średnie.
- Przy małym zbiorze danych zamiast jednego podziału używaj powtarzanej walidacji krzyżowej:
RepeatedStratifiedKFold. - Planując eksperyment, policz moc testu i wymaganą liczebność, zanim zbierzesz dane.
- Nie przerywaj testu A/B, gdy tylko wariant „wygrywa” po kilkudziesięciu obserwacjach.
Najczęstsze pytania
- Czym prawo małych liczb różni się od prawa wielkich liczb?
- Prawo wielkich liczb to twierdzenie matematyczne: przy dużym n średnia zbliża się do prawdy. Prawo małych liczb to błąd poznawczy: oczekiwanie, że to samo zachodzi już przy małym n.
- Dlaczego najlepsze i najgorsze wyniki mają małe grupy?
- Bo średnia z małej grupy ma duży rozrzut losowy. Nawet gdy wszystkie grupy są w rzeczywistości takie same, małe częściej przypadkiem lądują na skrajach rankingu.
- Ile obserwacji to „mała próbka”?
- Zależy od zmienności i od tego, jak małe różnice chcesz wykryć. Dla odsetka bliskiego 50% przy 100 obserwacjach przedział ufności ma szerokość około ±10 punktów procentowych.
Źródła
- Amos Tversky, Daniel Kahneman, „Belief in the law of small numbers”, Psychological Bulletin 76(2), 1971, s. 105–110.
- Amos Tversky, Daniel Kahneman, „Judgment under Uncertainty: Heuristics and Biases”, Science 185(4157), 1974, s. 1124–1131.
- Howard Wainer, „The Most Dangerous Equation”, American Scientist 95(3), 2007, s. 249–256.
- Daniel Kahneman, „Thinking, Fast and Slow”, Farrar, Straus and Giroux, 2011, rozdz. 10 (The Law of Small Numbers).