ML Atlas

01 · Podstawy · 4 min czytania · Interaktywne · aktualizacja

Co to jest przedział ufności i jak go poprawnie interpretować?

W skrócie

Przedział ufności to zakres wyliczony z próby metodą, która w 95% powtórzeń obejmuje prawdziwy parametr. Pokazuje, jak dokładny jest wynik.

Co to jest

Przedział ufności (confidence interval, CI) to zakres wartości obliczony z próby, który z określoną częstością — zwykle 95% — obejmuje nieznaną prawdziwą wartość parametru, na przykład średniej w populacji. Poziom ufności opisuje metodę, a nie pojedynczy przedział: gdyby powtarzać badanie wiele razy i za każdym razem liczyć przedział tą samą procedurą, około 95% przedziałów trafiłoby w prawdę.

Intuicja: pojedyncza liczba z próby („średnia masa 3701 g”) udaje pewność, której nie ma. Inna próba dałaby inną średnią. Przedział mówi, jak bardzo wynik mógłby się zmienić, a więc ile informacji naprawdę mamy. Wąski przedział oznacza dużo danych albo mały rozrzut; szeroki — że wynik ledwo trzyma się na nogach.

Mechanizm — dlaczego tak działa

Punkt wyjścia to rozkład próbkowy. Średnia z losowej próby jest zmienną losową, która waha się wokół prawdziwej średniej μ. Jej odchylenie standardowe nazywa się błędem standardowym: SE = s / √n, gdzie s to odchylenie standardowe w próbie, a n — liczebność. Z centralnego twierdzenia granicznego średnia ma rozkład w przybliżeniu normalny, więc w około 95% prób leży nie dalej niż 1,96·SE od μ.

Odwrócenie tego zdania daje przedział. Skoro średnia rzadko odchodzi od μ o więcej niż 1,96·SE, to μ rzadko leży dalej niż 1,96·SE od średniej. Stąd przepis x̄ ± 1,96·SE. Przy małych próbach zamiast 1,96 bierze się kwantyl rozkładu t Studenta (dla n = 20 to 2,09), bo s też jest tylko oszacowaniem i dokłada niepewności.

Najważniejsza konsekwencja wzoru: szerokość maleje jak 1/√n. Żeby zwęzić przedział o połowę, trzeba czterokrotnie więcej danych. To prawo malejących zysków rządzi planowaniem badań, testów A/B i oceną modeli na zbiorze testowym.

Interpretacja jest subtelna. Po obliczeniu konkretnego przedziału, np. [3627; 3774] g, prawdziwa średnia albo w nim jest, albo nie — w podejściu częstościowym parametr nie jest losowy i nie ma prawdopodobieństwa. „95%” to gwarancja procedury. Zdanie „z prawdopodobieństwem 95% średnia leży w tym przedziale” jest poprawne dla przedziału wiarygodności z wnioskowania bayesowskiego; w prostych przypadkach liczby bywają niemal identyczne, ale sens jest inny.

Zastrzeżenia. Przedział opisuje wyłącznie błąd losowy próbkowania. Nie chroni przed stronniczą próbą (ankieta tylko wśród chętnych), błędem pomiaru ani złym modelem. Wzór x̄ ± t·SE zakłada niezależne obserwacje; przy danych skorelowanych — szeregach czasowych, wielu pomiarach tej samej osoby — wychodzi za wąski. Dla median, kwantyli czy metryk modeli, które nie mają prostego wzoru na SE, stosuje się bootstrap.

Na przykładzie

Palmer Penguins: dla 151 pingwinów Adélie ze zmierzoną masą średnia wynosi 3700,7 g, odchylenie standardowe 458,6 g, więc SE = 37,3 g. Przedział 95% (kwantyl t = 1,98) to [3627; 3774] g. Dla 68 pingwinów maskowych (Chinstrap) średnia to 3733,1 g, a przedział [3640; 3826] g. Przedziały mocno się nakładają, więc z tych danych nie da się powiedzieć, który gatunek jest cięższy. Dla 123 pingwinów białobrewych (Gentoo) przedział [4986; 5166] g leży daleko od obu.

Co znaczy „95%”, można sprawdzić symulacją. Potraktujmy 151 ptaków Adélie jako całą populację (μ = 3700,7 g) i losujmy z niej ze zwracaniem próby po 20 osobników. W 10 000 powtórzeń przedział t objął μ w 94,99% przypadków — procedura dotrzymuje obietnicy. Pojedynczy przedział z 20 ptaków jest jednak szeroki: w jednej z prób wyszło [3663; 4090] g, czyli około 430 g szerokości wobec 148 g przy wszystkich 151 ptakach. Siedem razy więcej danych, przedział niecałe trzy razy węższy — dokładnie tak, jak przewiduje √n.

Ta ilustracja działa w przeglądarce z włączonym JavaScriptem: przedział ufności dla średniej masy pingwinów z prób bootstrapowych porównany ze wzorem średnia ± 1,96·s/√n.

Dane: Palmer Penguins (pingwiny z Antarktydy)

W praktyce

  • scipy.stats.t.interval(0.95, df=n-1, loc=x.mean(), scale=scipy.stats.sem(x)) daje przedział dla średniej; dla odsetka statsmodels.stats.proportion.proportion_confint(..., method='wilson') — Wilson jest lepszy niż „±1,96·SE” przy małym n albo odsetkach bliskich 0 lub 1.
  • Dla metryk modelu (trafność, AUC, F1) licz przedział bootstrapem zbioru testowego: scipy.stats.bootstrap albo własna pętla z numpy.random.default_rng.
  • Raportuj „0,84 (95% CI 0,81–0,87)”, nie samą liczbę. Różnica dwóch modeli mniejsza niż szerokość ich przedziałów zwykle nic nie znaczy.
  • Rozłączne przedziały oznaczają istotną różnicę, ale nakładanie się nie dowodzi jej braku. Do porównań licz przedział dla różnicy.
  • Typowy błąd: SE liczone na obserwacjach zależnych (wiele wierszy tego samego klienta). Wtedy losuj lub grupuj na poziomie klienta.

Najczęstsze pytania

Czy 95% przedział ufności oznacza 95% szansy, że prawdziwa wartość jest w środku?
Nie w ścisłym, częstościowym sensie. 95% to częstość, z jaką procedura trafia w prawdę przy wielu powtórzeniach; konkretny przedział albo zawiera parametr, albo nie. Interpretację „95% szansy” daje przedział wiarygodności w podejściu bayesowskim.
Dlaczego przedział zwęża się z pierwiastkiem z n, a nie z n?
Bo błędy pojedynczych obserwacji częściowo się znoszą. Wariancja średniej z n niezależnych pomiarów to σ²/n, a jej odchylenie standardowe — pierwiastek z tego. Czterokrotnie więcej danych daje dwa razy węższy przedział.
Czym różni się przedział ufności od przedziału predykcji?
Przedział ufności dotyczy parametru (średniej masy gatunku) i kurczy się do zera, gdy n rośnie. Przedział predykcji dotyczy pojedynczej nowej obserwacji (masy następnego pingwina) i nigdy nie jest węższy niż naturalny rozrzut danych.
Dlaczego akurat 95%?
To konwencja, nie prawo natury. Poziom 90% daje węższy przedział, 99% szerszy. Wybór powinien zależeć od kosztu pomyłki, a nie od przyzwyczajenia.

Źródła

  • Neyman, J. (1937). "Outline of a theory of statistical estimation based on the classical theory of probability". Philosophical Transactions of the Royal Society A, 236, 333–380.
  • Wasserman, L. (2004). All of Statistics. Springer, rozdz. 6 (zbiory ufności).
  • Hoekstra, R., Morey, R. D., Rouder, J. N., Wagenmakers, E.-J. (2014). "Robust misinterpretation of confidence intervals". Psychonomic Bulletin & Review, 21, 1157–1164.
  • Greenland, S. i in. (2016). "Statistical tests, P values, confidence intervals, and power: a guide to misinterpretations". European Journal of Epidemiology, 31, 337–350.

Zobacz też