ML Atlas

11 · Prawa i prawdy · 3 min czytania · Interaktywne · aktualizacja

Na czym polega paradoks Simpsona i jak go rozpoznać w danych?

W skrócie

Zależność widoczna w całych danych może zniknąć albo się odwrócić po podziale na grupy. Przykład rekrutacji w Berkeley w 1973 roku i wyjaśnienie dlaczego.

Co to jest

Trend widoczny w każdej z grup osobno może zniknąć albo odwrócić się po połączeniu grup w jedną całość. Opisał to Edward H. Simpson w 1951 roku (wcześniej zauważali to Karl Pearson i George Udny Yule), a najsłynniejszym przykładem stała się analiza rekrutacji na studia magisterskie w Berkeley, opublikowana przez Bickela, Hammela i O’Connella w „Science” w 1975 roku.

Paradoks nie jest błędem arytmetyki. Obie liczby — zagregowana i w podziale na grupy — są poprawne. Problem polega na tym, że odpowiadają na różne pytania, a my zwykle bierzemy tę, która jest pod ręką.

Dlatego paradoks Simpsona to przede wszystkim lekcja o przyczynowości: żeby wiedzieć, której liczbie wierzyć, trzeba wiedzieć, jak powstały dane.

Mechanizm — dlaczego tak działa

Ogólny odsetek w grupie to średnia ważona odsetków z podgrup, a wagami są liczebności. Jeśli dwie porównywane grupy (np. kobiety i mężczyźni) rozkładają się na podgrupy w bardzo różnych proporcjach, to porównujesz średnie z różnymi wagami. Wystarczy, że jedna grupa częściej trafia do „trudnych” podgrup, a jej wynik ogólny spadnie, nawet jeśli w każdej podgrupie radzi sobie lepiej.

W języku przyczynowym: istnieje trzecia zmienna (tu: wydział), która wpływa zarówno na to, kto aplikuje, jak i na szansę przyjęcia. To zmienna zakłócająca (confounder). Porównanie zagregowane miesza efekt płci z efektem wyboru wydziału.

Czy zawsze należy dzielić na grupy? Nie. Judea Pearl pokazuje, że decyzja zależy od struktury przyczynowej. Jeśli zmienna podziału jest przyczyną obu porównywanych rzeczy (zakłócająca), trzeba na nią warunkować. Jeśli jest skutkiem leczenia albo zmienną pośredniczącą, dzielenie po niej może wprowadzić błąd. Same dane tego nie rozstrzygną — potrzebny jest model tego, co na co wpływa.

Na przykładzie

Berkeley, jesień 1973, sześć największych wydziałów (A–F). Mężczyźni złożyli 2691 podań i dostali 1198 przyjęć — 44,5%. Kobiety złożyły 1835 podań i dostały 557 przyjęć — 30,4%. Różnica ponad 14 punktów procentowych wygląda na dyskryminację.

Teraz osobno w każdym wydziale (przyjęte kobiety vs mężczyźni): A — 82,4% vs 62,1%, B — 68,0% vs 63,0%, C — 34,1% vs 36,9%, D — 34,9% vs 33,1%, E — 23,9% vs 27,7%, F — 7,0% vs 5,9%. Kobiety mają wyższy odsetek przyjęć w czterech z sześciu wydziałów, a w pozostałych dwóch różnice są niewielkie. Klucz: 51,5% podań mężczyzn trafiło do łatwych wydziałów A i B (przyjmowały 63–64% kandydatów), a podań kobiet tylko 7,2%. Kobiety aplikowały głównie na wydziały C–F, gdzie przyjmowano od 6% do 35% chętnych. Gdyby kobiety rozłożyły podania tak jak mężczyźni, przy swoich odsetkach w każdym wydziale miałyby 51,6% przyjęć — więcej niż mężczyźni.

Ta ilustracja działa w przeglądarce z włączonym JavaScriptem: na Berkeley w 1973 roku przyjęto 44,5% mężczyzn i 30,4% kobiet, ale w 4 z 6 wydziałów kobiety miały wyższy odsetek przyjęć, bo częściej aplikowały na trudne wydziały.

Dane: Przyjęcia na Berkeley 1973

W praktyce

  • Zanim porównasz grupy, rozbij wynik po najważniejszych zmiennych: df.groupby(['dept', 'sex'])['admitted'].mean().unstack().
  • Sprawdź, czy porównywane grupy mają podobny rozkład po podgrupach: pd.crosstab(df.sex, df.dept, normalize='index').
  • Do korekty używaj standaryzacji (wagi z jednej grupy) lub modelu z kontrolą zmiennej, np. regresji logistycznej admitted ~ sex + dept.
  • Narysuj prosty graf przyczynowy (co wpływa na co), zanim zdecydujesz, po czym dzielić dane.
  • W ocenie modeli paradoks wraca: model lepszy w każdym segmencie może mieć gorszy wynik ogólny, jeśli testowano go na innej mieszance segmentów.

Najczęstsze pytania

Czy w Berkeley była dyskryminacja kobiet?
Te dane jej nie pokazują na poziomie decyzji wydziałów — w czterech z sześciu wydziałów kobiety były przyjmowane częściej. Bickel i współautorzy wskazali, że różnica wynikała z tego, gdzie kobiety aplikowały. Pytanie, dlaczego wydziały wybierane przez kobiety miały mniej miejsc, to już inne pytanie.
Której liczbie wierzyć: zagregowanej czy w podziale na grupy?
Zależy od pytania przyczynowego. Jeśli zmienna podziału wpływa na obie porównywane rzeczy, wierz liczbom w podziale. Jeśli jest skutkiem badanej przyczyny, dzielenie po niej może zafałszować wynik.
Jak często paradoks Simpsona zdarza się w praktyce?
Pełne odwrócenie kierunku jest rzadkie, ale osłabienie lub wzmocnienie efektu po kontroli zmiennej zakłócającej to codzienność w danych medycznych, biznesowych i społecznych.

Źródła

  • Edward H. Simpson, „The interpretation of interaction in contingency tables”, Journal of the Royal Statistical Society, Series B 13(2), 1951, s. 238–241.
  • Peter J. Bickel, Eugene A. Hammel, J. William O’Connell, „Sex bias in graduate admissions: data from Berkeley”, Science 187(4175), 1975, s. 398–404.
  • Judea Pearl, „Causality: Models, Reasoning, and Inference”, 2nd ed., Cambridge University Press, 2009, rozdz. 6.
  • Judea Pearl, Madelyn Glymour, Nicholas P. Jewell, „Causal Inference in Statistics: A Primer”, Wiley, 2016, rozdz. 1.

Zobacz też