ML Atlas

11 · Prawa i prawdy · 3 min czytania · Interaktywne · aktualizacja

Czym jest kwartet Anscombe’a i dlaczego trzeba rysować dane?

W skrócie

Cztery zbiory o identycznych średnich, wariancjach, korelacji i prostej regresji wyglądają na wykresie zupełnie inaczej. Dlaczego statystyki nie wystarczą.

Co to jest

Te same statystyki opisowe mogą opisywać zupełnie różne dane, więc zanim zaufasz liczbom, musisz zobaczyć wykres. Pokazał to Francis Anscombe w 1973 roku, konstruując cztery małe zbiory po 11 punktów, które mają niemal identyczne średnie, wariancje, korelację i prostą regresji.

Na wykresie pierwszy zbiór to zwykła chmura punktów wokół prostej. Drugi to gładka parabola. Trzeci to idealna prosta z jednym punktem odstającym. Czwarty to pionowa kolumna punktów i jeden samotny punkt daleko w prawo. Cztery różne historie, jedna tabelka liczb.

Anscombe pisał to w czasach, gdy komputer liczył statystyki, ale rysowanie wykresów było kosztowne, a wielu statystyków uważało je za mniej „ścisłe” niż liczby. Kwartet był argumentem przeciwko temu przekonaniu i do dziś jest pierwszym przykładem w nauce eksploracyjnej analizy danych.

Mechanizm — dlaczego tak działa

Średnia, wariancja i współczynnik korelacji to podsumowania: każde z nich ściska wiele liczb do jednej. Kompresja z definicji gubi informację, a wiele różnych zbiorów ma te same podsumowania. Współczynnik korelacji Pearsona mierzy tylko siłę zależności liniowej i jest wrażliwy na pojedyncze skrajne punkty, bo opiera się na kwadratach odchyleń.

Prosta regresji metodą najmniejszych kwadratów zależy tylko od średnich, wariancji i kowariancji. Jeśli te są równe, prosta jest ta sama — bez względu na to, czy dane są liniowe, zakrzywione, czy zdominowane przez jeden punkt. Metoda zawsze coś dopasuje; nie powie, że model jest zły.

Dlatego ta sama liczba (np. r = 0,82) może znaczyć „umiarkowanie silna liniowa zależność z szumem”, „idealna nieliniowa zależność opisana złym modelem” albo „żadnej zależności, tylko jeden punkt dźwigni”. Rozstrzyga dopiero wykres danych i wykres reszt.

W 2017 roku Justin Matejka i George Fitzmaurice uogólnili ten pomysł: algorytmem wyżarzania wygenerowali tuzin zbiorów (m.in. w kształcie dinozaura) o identycznych statystykach do dwóch miejsc po przecinku. Kwartet nie jest więc ciekawostką, tylko regułą: statystyk jest mało, możliwych kształtów — nieskończenie wiele.

Na przykładzie

Policzone z pliku z kwartetem: w każdym z czterech zbiorów średnia x wynosi 9,0, wariancja x 11,0, średnia y 7,50, wariancja y od 4,12 do 4,13, korelacja 0,816–0,817, a prosta regresji to y ≈ 3,00 + 0,500·x z R² ≈ 0,67. Na podstawie tabeli nie da się ich odróżnić.

Różnice wychodzą po bliższym spojrzeniu. W zbiorze II parabola (wielomian 2. stopnia) wyjaśnia praktycznie 100% wariancji — prosta była złym modelem. W zbiorze III dziesięć punktów leży idealnie na prostej o nachyleniu 0,345 (korelacja 1,000), a jeden punkt o y = 12,74 podnosi nachylenie do 0,50 i obniża korelację do 0,82. W zbiorze IV dziesięć punktów ma to samo x = 8, a jedyny punkt z x = 19 sam wyznacza całe nachylenie — bez niego zależności nie da się nawet policzyć.

Ta ilustracja działa w przeglądarce z włączonym JavaScriptem: cztery zbiory po 11 punktów o tej samej średniej, korelacji 0,82 i prostej y = 3 + 0,5·x wyglądają zupełnie inaczej: chmura, parabola, punkt odstający, punkt dźwigni.

W praktyce

  • Zawsze rysuj: sns.scatterplot dla par, sns.pairplot(df) dla wielu zmiennych, sns.lmplot(data=df, x='x', y='y', col='dataset') dla kwartetu.
  • Po dopasowaniu regresji obejrzyj reszty (sns.residplot); wzór w resztach oznacza zły kształt modelu.
  • Sprawdzaj wpływ pojedynczych punktów: dźwignię i odległość Cooka (statsmodels → get_influence().cooks_distance).
  • Obok korelacji Pearsona licz korelację Spearmana (df.corr(method='spearman')), mniej wrażliwą na punkty odstające.
  • W pandas df.describe() to dobry początek, ale nigdy koniec analizy.

Najczęstsze pytania

Co pokazuje kwartet Anscombe’a?
Że średnie, wariancje, korelacja i prosta regresji mogą być identyczne dla danych o zupełnie innym kształcie. Statystyki opisowe nie zastąpią wykresu.
Czy korelacja 0,82 oznacza silną zależność liniową?
Nie zawsze. W kwartecie ta sama korelacja opisuje szum wokół prostej, parabolę, prostą z jednym punktem odstającym i dane, w których zależność tworzy jeden punkt.
Gdzie znaleźć dane kwartetu?
Są w wielu bibliotekach, m.in. w seaborn (`sns.load_dataset('anscombe')`) i w R (`datasets::anscombe`). To cztery zbiory po 11 par (x, y).

Źródła

  • Francis J. Anscombe, „Graphs in Statistical Analysis”, The American Statistician 27(1), 1973, s. 17–21.
  • Justin Matejka, George Fitzmaurice, „Same Stats, Different Graphs: Generating Datasets with Varied Appearance and Identical Statistics through Simulated Annealing”, Proceedings of CHI 2017, ACM.
  • John W. Tukey, „Exploratory Data Analysis”, Addison-Wesley, 1977.
  • Gareth James i in., „An Introduction to Statistical Learning”, 2nd ed., Springer, 2021, rozdz. 3 (Linear Regression).

Zobacz też