02 · Dane · 3 min czytania · Interaktywne · aktualizacja
Jakie są podstawowe statystyki opisowe i kiedy średnia wprowadza w błąd?
W skrócie
Statystyki opisowe streszczają rozkład kilkoma liczbami: położenie, rozrzut i kształt. Średnia i odchylenie są wrażliwe na skośność, mediana i IQR odporne.
Co to jest
Statystyki opisowe to liczby streszczające rozkład zmiennej: gdzie leży jej „środek” (średnia, mediana, dominanta), jak bardzo wartości się rozrzucają (odchylenie standardowe, rozstęp międzykwartylowy, zakres) i jaki ma kształt (skośność, kurtoza). Dla par zmiennych dochodzą miary zależności, takie jak kowariancja i korelacja.
Podsumowanie jest kompresją: setki czy tysiące wartości zastępujemy kilkoma liczbami. To wygodne i niezbędne, ale każda kompresja coś gubi — i trzeba wiedzieć, co.
Intuicja: średni majątek w sali, do której wchodzi miliarder, rośnie gwałtownie, choć nikt z obecnych nie stał się bogatszy. Mediana prawie się nie zmienia.
Mechanizm — dlaczego tak działa
Średnia x̄ = (x₁ + … + xₙ) / n minimalizuje sumę kwadratów odległości od punktów. Kwadrat sprawia, że daleki punkt „ciągnie” ją bardzo mocno, więc jedna skrajna wartość może przesunąć średnią dowolnie daleko. Mediana — wartość środkowa po posortowaniu — minimalizuje sumę bezwzględnych odległości; skrajne punkty liczą się tylko tym, po której stronie leżą. Mówimy, że mediana jest odporna (ma punkt załamania 50%), a średnia nie (punkt załamania 0%).
To samo dotyczy rozrzutu. Odchylenie standardowe s = √(Σ(xᵢ − x̄)² / (n − 1)) dziedziczy wrażliwość średniej. Rozstęp międzykwartylowy IQR = Q3 − Q1 opisuje szerokość środkowej połowy danych i ignoruje ogony. Dzielnik n − 1 zamiast n (poprawka Bessela) koryguje fakt, że odchylenia liczymy od średniej z próby, a nie od prawdziwej.
Relacja średniej i mediany mówi o kształcie. Gdy średnia jest wyraźnie większa od mediany, rozkład ma długi prawy ogon (dochody, ceny, czasy oczekiwania). W rozkładzie symetrycznym obie są bliskie. Dlatego „przeciętny” w raporcie warto doprecyzować: czy to średnia, czy mediana?
Granica podsumowań: zupełnie różne dane mogą mieć te same statystyki. Kwartet Anscombe’a to cztery zbiory o identycznych średnich, wariancjach i korelacji, z których tylko jeden pasuje do modelu liniowego. Korelacja Pearsona mierzy wyłącznie zależność liniową i jest wrażliwa na pojedyncze punkty. Statystyki opisowe trzeba więc czytać razem z wykresem rozkładu.
Wreszcie: statystyka z próby jest zmienną losową. Średnia ze 100 obserwacji ma własny błąd standardowy s / √n — inna próba dałaby inną liczbę.
Na przykładzie
W zbiorze Titanic opłata za bilet (fare) ma średnią 32,2 i medianę 14,45 — średnia jest ponad dwa razy większa. Odchylenie standardowe wynosi 49,7, więcej niż sama średnia, a maksimum 512,33. Kwartyle mówią więcej: połowa pasażerów zapłaciła między 7,91 a 31,0 (IQR = 23,1). Kilka bardzo drogich biletów w pierwszej klasie ciągnie średnią i odchylenie w górę; mediana i IQR opisują typowego pasażera znacznie lepiej.
Dla kontrastu masa ciała pingwinów (Palmer Penguins, 342 ptaki z pomiarem) ma średnią 4202 g i medianę 4050 g, odchylenie 802 g i skośność 0,47 — rozkład umiarkowanie asymetryczny, więc obie miary środka są bliskie. Kwartet Anscombe’a domyka lekcję: we wszystkich czterech zbiorach średnia x wynosi 9,0, średnia y 7,50, wariancja x 11,0, wariancja y 4,12, a korelacja 0,82 — przy całkowicie różnych kształtach.
Dane: Titanic Palmer Penguins (pingwiny z Antarktydy) Kwartet Anscombe’a
W praktyce
df.describe()daje liczność, średnią, odchylenie, minimum, kwartyle i maksimum;df.skew()idf.kurt()dodają kształt.- Dla skośnych zmiennych raportuj medianę i IQR (
df.quantile([.25, .5, .75])) albo statystyki po logarytmowaniu (np.log1p). - Statystyki w podgrupach:
df.groupby('grupa')['x'].agg(['mean', 'median', 'std']). - Pamiętaj, że pandas liczy
stdz dzielnikiem n − 1, a NumPy (np.std) domyślnie z n. - Korelację Spearmana (
df.corr(method='spearman')) stosuj, gdy zależność jest monotoniczna, ale nie liniowa, lub są wartości odstające. - Typowy błąd: raportowanie samej średniej bez miary rozrzutu i bez wykresu.
Najczęstsze pytania
- Kiedy używać średniej, a kiedy mediany?
- Średnia jest dobra dla rozkładów zbliżonych do symetrycznych i gdy liczy się suma (np. łączny koszt). Mediana lepiej opisuje typową obserwację w danych skośnych lub z wartościami odstającymi, np. dochody czy ceny mieszkań.
- Czym różni się odchylenie standardowe od błędu standardowego?
- Odchylenie standardowe opisuje rozrzut pojedynczych obserwacji. Błąd standardowy opisuje niepewność oszacowania, np. średniej, i maleje jak 1/√n wraz z liczbą obserwacji.
- Czy dwie zmienne o korelacji 0 są niezależne?
- Nie. Korelacja Pearsona równa zero oznacza brak zależności liniowej. Zmienna y = x² dla x symetrycznego wokół zera ma korelację bliską zeru, choć jest całkowicie wyznaczona przez x.
Źródła
- Tukey J. W. (1977). „Exploratory Data Analysis”. Addison-Wesley.
- Anscombe F. J. (1973). „Graphs in Statistical Analysis”. The American Statistician, 27(1), 17–21.
- James G., Witten D., Hastie T., Tibshirani R. „An Introduction to Statistical Learning”, 2nd ed., 2021, rozdz. 2 i 3.1.
- Dokumentacja pandas:
DataFrame.describe, https://pandas.pydata.org/docs/reference/api/pandas.DataFrame.describe.html