ML Atlas

11 · Prawa i prawdy · 4 min czytania · aktualizacja

Na czym polega paradoks Steina i dlaczego ściąganie estymatorów działa?

W skrócie

Przy trzech lub więcej szacowanych średnich ściągnięcie wszystkich w stronę wspólnego punktu daje mniejszy łączny błąd niż osobne średnie. Wyjaśniamy dlaczego.

Co to jest

Gdy szacujesz jednocześnie trzy lub więcej średnich, zwykłe średnie z próbek są gorsze (w sumie kwadratów błędów) od estymatora, który ściąga je wszystkie w stronę wspólnego punktu — nawet gdy te wielkości nie mają ze sobą nic wspólnego. Udowodnił to Charles Stein w 1956 roku, a konkretny estymator podali Willard James i Stein w 1961 roku. Szerokiej publiczności przedstawili go Bradley Efron i Carl Morris w „Scientific American” w 1977 roku.

Brzmi absurdalnie. Chcesz oszacować średnią skuteczność rzutów koszykarza, cenę herbaty i wzrost żyraf. Paradoks mówi, że łączny błąd będzie mniejszy, jeśli każde z tych oszacowań lekko przesuniesz w stronę ich wspólnej średniej. Żadna z wielkości nie wie o pozostałych, a jednak to działa.

Ten wynik zszokował statystyków, bo podważył przekonanie, że średnia z próbki jest „najlepszym” estymatorem średniej. Dziś jest teoretycznym fundamentem regularyzacji, metod bayesowskich i modeli hierarchicznych.

Mechanizm — dlaczego tak działa

Wektor obserwacji x jest zaszumioną wersją prawdziwego wektora θ. Szum dodaje się w każdym wymiarze, więc oczekiwana długość kwadratowa ‖x‖² jest większa od ‖θ‖² o liczbę wymiarów k. Innymi słowy, obserwacje są systematycznie „za daleko” od zera (czy dowolnego punktu odniesienia). Przy wielu wymiarach ten nadmiar jest przewidywalny i można go odjąć.

Estymator Jamesa–Steina robi dokładnie to: θ̂ = (1 − (k − 2) / ‖x‖²) · x. Mnożnik jest mniejszy od 1, więc wszystko ściąga się w stronę zera. Gdy obserwacje leżą blisko zera (‖x‖² małe w stosunku do k), ściąganie jest silne, gdy daleko — słabe. Dla k ≥ 3 ten estymator ma mniejszy oczekiwany łączny błąd kwadratowy niż x dla każdego możliwego θ.

To czysty kompromis obciążenia i wariancji. Ściąganie dodaje małe obciążenie, ale usuwa więcej wariancji, niż dodaje obciążenia. Przy jednej lub dwóch średnich zysk z redukcji wariancji nie przewyższa straty — stąd próg k ≥ 3.

Ważne zastrzeżenia. Wygrana dotyczy sumy błędów, nie każdej wielkości z osobna: pojedyncza nietypowa średnia może zostać oszacowana gorzej. Zysk jest największy, gdy prawdziwe wartości leżą blisko punktu, do którego ściągasz; jeśli są daleko, estymator wciąż nie przegrywa, ale wygrywa minimalnie. W praktyce ściąga się do średniej ogólnej, a nie do zera.

Na przykładzie

Symulacja (numpy, default_rng(2)): 10 prawdziwych średnich θ wylosowanych raz z rozkładu normalnego (od −2,44 do 1,80). W każdym z 10 000 powtórzeń obserwujemy x = θ + szum o odchyleniu 1 i porównujemy sumę kwadratów błędów. Zwykłe obserwacje dają średnio 9,98 (teoria: 10). Estymator Jamesa–Steina — 6,57, czyli o około jedną trzecią mniej. Wersja, która nie pozwala mnożnikowi spaść poniżej zera, daje 6,53, a ściąganie do średniej z obserwacji zamiast do zera — 7,24. James–Stein wygrał w 86,7% powtórzeń.

Gdy te same średnie przesuniemy o 5 (daleko od zera, do którego ściągamy), zwykłe obserwacje mają błąd 9,96, a James–Stein 9,71. Wciąż lepiej, ale zysk prawie znika — punkt ściągania ma znaczenie.

W praktyce

  • Regresja grzbietowa (sklearn.linear_model.Ridge) to ten sam pomysł w modelach liniowych: ściąganie współczynników do zera zmniejsza błąd przewidywania.
  • Kodowanie kategorii średnią celu (TargetEncoder w scikit-learn) wygładza średnie rzadkich kategorii w stronę średniej globalnej — to estymacja w duchu Steina.
  • Rankingi (produktów, sklepów, graczy) z małą liczbą ocen ściągaj w stronę średniej ogólnej zamiast sortować surowe średnie.
  • Modele hierarchiczne (np. w PyMC lub statsmodels MixedLM) uczą siły ściągania z danych.
  • Nie ściągaj, gdy potrzebujesz nieobciążonego oszacowania jednej konkretnej wielkości, np. w raporcie regulacyjnym.

Najczęstsze pytania

Dlaczego paradoks Steina działa dopiero od trzech średnich?
Bo przy jednym lub dwóch wymiarach nadmiar długości wektora obserwacji jest za mały, by jego usunięcie zrekompensowało obciążenie. Od k = 3 redukcja wariancji wygrywa dla każdej prawdziwej wartości.
Czy to znaczy, że średnia z próbki jest złym estymatorem?
Dla jednej wielkości jest bardzo dobra. Paradoks dotyczy łącznego szacowania wielu wielkości i łącznego błędu kwadratowego. W tym zadaniu średnie z próbek są „niedopuszczalne” — istnieje estymator zawsze od nich lepszy.
Jak paradoks Steina wiąże się z regularyzacją?
Bezpośrednio. Ridge, kara L2 w sieciach neuronowych i bayesowskie rozkłady a priori ściągają oszacowania w stronę zera lub średniej, wymieniając małe obciążenie na dużą redukcję wariancji — dokładnie jak James–Stein.

Źródła

  • Charles Stein, „Inadmissibility of the usual estimator for the mean of a multivariate normal distribution”, Proceedings of the Third Berkeley Symposium on Mathematical Statistics and Probability, vol. 1, 1956, s. 197–206.
  • Willard James, Charles Stein, „Estimation with quadratic loss”, Proceedings of the Fourth Berkeley Symposium on Mathematical Statistics and Probability, vol. 1, 1961, s. 361–379.
  • Bradley Efron, Carl Morris, „Stein’s paradox in statistics”, Scientific American 236(5), 1977, s. 119–127.
  • Bradley Efron, Trevor Hastie, „Computer Age Statistical Inference”, Cambridge University Press, 2016, rozdz. 7 (James–Stein Estimation and Ridge Regression).

Zobacz też