11 · Prawa i prawdy · 4 min czytania · aktualizacja
Na czym polega paradoks Steina i dlaczego ściąganie estymatorów działa?
W skrócie
Przy trzech lub więcej szacowanych średnich ściągnięcie wszystkich w stronę wspólnego punktu daje mniejszy łączny błąd niż osobne średnie. Wyjaśniamy dlaczego.
Co to jest
Gdy szacujesz jednocześnie trzy lub więcej średnich, zwykłe średnie z próbek są gorsze (w sumie kwadratów błędów) od estymatora, który ściąga je wszystkie w stronę wspólnego punktu — nawet gdy te wielkości nie mają ze sobą nic wspólnego. Udowodnił to Charles Stein w 1956 roku, a konkretny estymator podali Willard James i Stein w 1961 roku. Szerokiej publiczności przedstawili go Bradley Efron i Carl Morris w „Scientific American” w 1977 roku.
Brzmi absurdalnie. Chcesz oszacować średnią skuteczność rzutów koszykarza, cenę herbaty i wzrost żyraf. Paradoks mówi, że łączny błąd będzie mniejszy, jeśli każde z tych oszacowań lekko przesuniesz w stronę ich wspólnej średniej. Żadna z wielkości nie wie o pozostałych, a jednak to działa.
Ten wynik zszokował statystyków, bo podważył przekonanie, że średnia z próbki jest „najlepszym” estymatorem średniej. Dziś jest teoretycznym fundamentem regularyzacji, metod bayesowskich i modeli hierarchicznych.
Mechanizm — dlaczego tak działa
Wektor obserwacji x jest zaszumioną wersją prawdziwego wektora θ. Szum dodaje się w każdym wymiarze, więc oczekiwana długość kwadratowa ‖x‖² jest większa od ‖θ‖² o liczbę wymiarów k. Innymi słowy, obserwacje są systematycznie „za daleko” od zera (czy dowolnego punktu odniesienia). Przy wielu wymiarach ten nadmiar jest przewidywalny i można go odjąć.
Estymator Jamesa–Steina robi dokładnie to: θ̂ = (1 − (k − 2) / ‖x‖²) · x. Mnożnik jest mniejszy od 1, więc wszystko ściąga się w stronę zera. Gdy obserwacje leżą blisko zera (‖x‖² małe w stosunku do k), ściąganie jest silne, gdy daleko — słabe. Dla k ≥ 3 ten estymator ma mniejszy oczekiwany łączny błąd kwadratowy niż x dla każdego możliwego θ.
To czysty kompromis obciążenia i wariancji. Ściąganie dodaje małe obciążenie, ale usuwa więcej wariancji, niż dodaje obciążenia. Przy jednej lub dwóch średnich zysk z redukcji wariancji nie przewyższa straty — stąd próg k ≥ 3.
Ważne zastrzeżenia. Wygrana dotyczy sumy błędów, nie każdej wielkości z osobna: pojedyncza nietypowa średnia może zostać oszacowana gorzej. Zysk jest największy, gdy prawdziwe wartości leżą blisko punktu, do którego ściągasz; jeśli są daleko, estymator wciąż nie przegrywa, ale wygrywa minimalnie. W praktyce ściąga się do średniej ogólnej, a nie do zera.
Na przykładzie
Symulacja (numpy, default_rng(2)): 10 prawdziwych średnich θ wylosowanych raz z rozkładu normalnego (od −2,44 do 1,80). W każdym z 10 000 powtórzeń obserwujemy x = θ + szum o odchyleniu 1 i porównujemy sumę kwadratów błędów. Zwykłe obserwacje dają średnio 9,98 (teoria: 10). Estymator Jamesa–Steina — 6,57, czyli o około jedną trzecią mniej. Wersja, która nie pozwala mnożnikowi spaść poniżej zera, daje 6,53, a ściąganie do średniej z obserwacji zamiast do zera — 7,24. James–Stein wygrał w 86,7% powtórzeń.
Gdy te same średnie przesuniemy o 5 (daleko od zera, do którego ściągamy), zwykłe obserwacje mają błąd 9,96, a James–Stein 9,71. Wciąż lepiej, ale zysk prawie znika — punkt ściągania ma znaczenie.
W praktyce
- Regresja grzbietowa (
sklearn.linear_model.Ridge) to ten sam pomysł w modelach liniowych: ściąganie współczynników do zera zmniejsza błąd przewidywania. - Kodowanie kategorii średnią celu (
TargetEncoderw scikit-learn) wygładza średnie rzadkich kategorii w stronę średniej globalnej — to estymacja w duchu Steina. - Rankingi (produktów, sklepów, graczy) z małą liczbą ocen ściągaj w stronę średniej ogólnej zamiast sortować surowe średnie.
- Modele hierarchiczne (np. w
PyMClubstatsmodelsMixedLM) uczą siły ściągania z danych. - Nie ściągaj, gdy potrzebujesz nieobciążonego oszacowania jednej konkretnej wielkości, np. w raporcie regulacyjnym.
Najczęstsze pytania
- Dlaczego paradoks Steina działa dopiero od trzech średnich?
- Bo przy jednym lub dwóch wymiarach nadmiar długości wektora obserwacji jest za mały, by jego usunięcie zrekompensowało obciążenie. Od k = 3 redukcja wariancji wygrywa dla każdej prawdziwej wartości.
- Czy to znaczy, że średnia z próbki jest złym estymatorem?
- Dla jednej wielkości jest bardzo dobra. Paradoks dotyczy łącznego szacowania wielu wielkości i łącznego błędu kwadratowego. W tym zadaniu średnie z próbek są „niedopuszczalne” — istnieje estymator zawsze od nich lepszy.
- Jak paradoks Steina wiąże się z regularyzacją?
- Bezpośrednio. Ridge, kara L2 w sieciach neuronowych i bayesowskie rozkłady a priori ściągają oszacowania w stronę zera lub średniej, wymieniając małe obciążenie na dużą redukcję wariancji — dokładnie jak James–Stein.
Źródła
- Charles Stein, „Inadmissibility of the usual estimator for the mean of a multivariate normal distribution”, Proceedings of the Third Berkeley Symposium on Mathematical Statistics and Probability, vol. 1, 1956, s. 197–206.
- Willard James, Charles Stein, „Estimation with quadratic loss”, Proceedings of the Fourth Berkeley Symposium on Mathematical Statistics and Probability, vol. 1, 1961, s. 361–379.
- Bradley Efron, Carl Morris, „Stein’s paradox in statistics”, Scientific American 236(5), 1977, s. 119–127.
- Bradley Efron, Trevor Hastie, „Computer Age Statistical Inference”, Cambridge University Press, 2016, rozdz. 7 (James–Stein Estimation and Ridge Regression).