ML Atlas

11 · Prawa i prawdy · 4 min czytania · Interaktywne · aktualizacja

Czym jest regresja do średniej i dlaczego najlepsi wypadają potem gorzej?

W skrócie

Skrajny wynik w jednym pomiarze zwykle oznacza też skrajne szczęście, więc kolejny pomiar wypada bliżej średniej. Dlaczego to zjawisko myli badaczy.

Co to jest

Jeśli dwa pomiary są ze sobą skorelowane niedoskonale, to osoby skrajne w pierwszym pomiarze będą przeciętnie mniej skrajne w drugim. Zjawisko opisał Francis Galton w 1886 roku: dzieci bardzo wysokich rodziców są przeciętnie wysokie, ale niższe od rodziców; nazwał to „regresją ku przeciętności”. Od tej pracy pochodzi samo słowo „regresja” w statystyce.

Codzienne przykłady: uczeń, który najlepiej napisał pierwszy sprawdzian, na drugim wypada słabiej. Sportowiec po rekordowym sezonie ma potem gorszy. Pacjenci zapisani na terapię w dniu najgorszego bólu poczują się lepiej nawet bez leczenia. Nikt tu nie „spuścił z tonu” — to statystyka.

Regresja do średniej nie jest siłą, która ciągnie ludzi w stronę przeciętności. Rozkład całej grupy w drugim pomiarze jest tak samo szeroki jak w pierwszym. Zmienia się tylko to, kto jest na krańcach.

Mechanizm — dlaczego tak działa

Każdy wynik to suma dwóch składników: stałej cechy (umiejętności, wzrostu, zdrowia) i chwilowego szumu (szczęścia, formy dnia, błędu pomiaru). Gdy wybierasz osoby z najwyższym wynikiem, wybierasz tych, którzy mają wysoką cechę i zwykle dodatni szum, bo szczęście pomaga dostać się na szczyt. W drugim pomiarze cecha zostaje, ale szum losuje się od nowa i przeciętnie wynosi zero. Wynik spada do poziomu samej cechy.

Ile spada? Jeśli oba pomiary są standaryzowane i skorelowane współczynnikiem r, najlepsza prognoza drugiego wyniku to r razy pierwszy wynik (w jednostkach odchylenia standardowego od średniej). Przy r = 1 nie ma regresji, przy r = 0 każdy wraca do średniej, przy r = 0,5 osoba o dwa odchylenia ponad średnią przeciętnie trafi o jedno odchylenie ponad średnią. Im więcej szumu w pomiarze, tym silniejsza regresja.

Działa to w obie strony i symetrycznie w czasie. Najgorsi w pierwszym teście poprawią się w drugim; najlepsi w drugim teście mieli przeciętnie gorszy pierwszy. To dowód, że nie ma tu przyczyny — jest tylko selekcja na zaszumionej zmiennej.

Pułapka polega na tym, że ludzie dorabiają przyczyny. Daniel Kahneman opisał instruktorów lotniczych przekonanych, że pochwała szkodzi, a krzyk pomaga: po wyjątkowo dobrym locie i pochwale kolejny był gorszy, po fatalnym i krzyku — lepszy. Obie zmiany były regresją do średniej. Dlatego badania skuteczności terapii, szkoleń czy zmian w produkcie potrzebują grupy kontrolnej, wybranej tak samo.

Na przykładzie

Symulacja (numpy, default_rng(1)): 10 000 osób o prawdziwej umiejętności z rozkładu normalnego o średniej 100 i odchyleniu 10. Każda pisze dwa testy, a każdy test dodaje niezależny szum o odchyleniu 10. Korelacja między testami wynosi 0,51.

Najlepsze 10% w pierwszym teście uzyskało średnio 124,9 punktu. W drugim teście te same osoby miały średnio 112,4 — spadek o ponad 12 punktów, a pogorszyło się 84,1% z nich. Ich prawdziwa umiejętność wynosiła średnio 112,4: drugi test pokazał ją uczciwie, pierwszy był zawyżony szczęściem. Najsłabsze 10% „poprawiło się” z 74,8 do 87,1 bez żadnej interwencji. Spadek i wzrost to mniej więcej połowa dystansu do średniej, zgodnie z r ≈ 0,5.

Ta ilustracja działa w przeglądarce z włączonym JavaScriptem: najlepsi w pierwszym teście wypadają gorzej w drugim, a nachylenie test 2 do test 1 równa się rzetelności pomiaru.

W praktyce

  • Wybór najlepszego modelu z wielu na tym samym zbiorze walidacyjnym to selekcja na szumie: jego wynik na nowym zbiorze testowym przeciętnie spadnie (klątwa zwycięzcy).
  • W eksperymentach A/B wariant, który prowadził po pierwszym dniu, zwykle traci przewagę; decyzję podejmuj po zaplanowanej liczbie obserwacji.
  • Oceniając efekt interwencji, porównuj z grupą kontrolną, nie z pomiarem „przed”, jeśli do interwencji trafiły skrajne przypadki.
  • Prognozę dla skrajnego przypadku ściągaj w stronę średniej (shrinkage): to samo robią regularyzacja i estymatory bayesowskie.
  • Sprawdź rzetelność pomiaru (np. korelację test–retest); niska rzetelność oznacza silną regresję.

Najczęstsze pytania

Czy regresja do średniej oznacza, że wszyscy stają się przeciętni?
Nie. Rozrzut całej grupy w drugim pomiarze jest taki sam. Część osób skrajnych wraca bliżej średniej, a ich miejsce na krańcach zajmują inni, którym tym razem dopisało szczęście.
Skąd wiadomo, że poprawa to regresja, a nie skutek leczenia?
Bez grupy kontrolnej nie wiadomo. Trzeba porównać osoby leczone z podobnie wybranymi osobami nieleczonymi; tylko różnica między grupami mówi o efekcie terapii.
Co ma regresja do średniej wspólnego z regresją liniową?
Nazwę i matematykę. Galton zauważył, że linia najlepszego dopasowania wzrostu dzieci do wzrostu rodziców ma nachylenie mniejsze niż 1, i to „cofanie się” nazwał regresją. Współczynnik nachylenia dla standaryzowanych danych to właśnie r.

Źródła

  • Francis Galton, „Regression towards mediocrity in hereditary stature”, Journal of the Anthropological Institute of Great Britain and Ireland 15, 1886, s. 246–263.
  • Daniel Kahneman, „Thinking, Fast and Slow”, Farrar, Straus and Giroux, 2011, rozdz. 17 (Regression to the Mean).
  • Adrian G. Barnett, Jolieke C. van der Pols, Annette J. Dobson, „Regression to the mean: what it is and how to deal with it”, International Journal of Epidemiology 34(1), 2005, s. 215–220.
  • Amos Tversky, Daniel Kahneman, „Judgment under Uncertainty: Heuristics and Biases”, Science 185(4157), 1974, s. 1124–1131.

Zobacz też