ML Atlas

11 · Prawa i prawdy · 3 min czytania · aktualizacja

Na czym polega paradoks Berksona i skąd biorą się fałszywe korelacje przy selekcji?

W skrócie

Gdy do próbki trafiają tylko obiekty spełniające jakiś warunek, niezależne cechy zaczynają wyglądać na ujemnie skorelowane. Skąd to się bierze.

Co to jest

Dwie cechy niezależne w populacji stają się skorelowane (zwykle ujemnie) w próbce wybranej na podstawie tych cech. Opisał to Joseph Berkson w 1946 roku na przykładzie danych szpitalnych: choroby, które w populacji nie mają ze sobą związku, wśród pacjentów szpitala wyglądały na powiązane.

Intuicja: czemu przystojni ludzie wydają się mniej sympatyczni? Może dlatego, że umawiasz się z kimś, kto jest przystojny albo sympatyczny. Ktoś, kto nie ma żadnej z tych cech, do twojej próbki nie trafia. Wśród tych, którzy trafili, brak jednej cechy musi być „wynagrodzony” drugą — więc w próbce wygląda to na kompromis, którego w populacji nie ma.

To samo widać w rekrutacji (przyjęci z gorszymi ocenami mają lepsze rozmowy), w publikacjach naukowych (efekty o małej próbie muszą być duże, żeby przejść próg istotności) i w danych, które ktoś odsiał przed tobą.

Mechanizm — dlaczego tak działa

Selekcja na podstawie funkcji dwóch zmiennych — np. ich sumy powyżej progu — wycina z płaszczyzny jeden róg. Zostaje pas punktów wzdłuż ukośnej granicy. W tym pasie wysoka wartość jednej cechy idzie w parze z niższą wartością drugiej, bo tylko tak można przekroczyć próg „ledwo”. Korelacja nie istnieje w świecie, tworzy ją filtr.

W języku grafów przyczynowych (Judea Pearl) wybór do próbki jest zderzaczem (collider): obie cechy na niego wpływają. Warunkowanie na zderzaczu — czyli patrzenie tylko na tych, którzy przeszli selekcję — otwiera fałszywą ścieżkę między jego przyczynami. To odwrotność zmiennej zakłócającej: na zakłócającą trzeba warunkować, na zderzacz nie wolno.

Paradoks dotyczy każdej analizy, w której dane są już przefiltrowane: pacjentów szpitala, klientów, którzy kupili, kandydatów, którzy przeszli pierwszy etap, modeli, które trafiły do publikacji. Nie da się go wykryć w samych danych po selekcji — trzeba wiedzieć, jak powstała próbka.

Zastrzeżenie: kierunek nie zawsze jest ujemny. Zależy od reguły selekcji. Wybór „obie cechy wysokie” albo „obie niskie” może dać korelację dodatnią. Stała pozostaje tylko zasada: selekcja na skutku zniekształca związek między przyczynami.

Na przykładzie

Symulacja (numpy, default_rng(11)): 10 000 obiektów z dwiema niezależnymi cechami A i B o rozkładzie normalnym. Korelacja w całej populacji: 0,01 — brak związku. Wybieramy 20% obiektów o najwyższej sumie A + B, czyli 2000 „przyjętych”. Wśród nich korelacja A i B wynosi −0,63. Silna, ujemna i całkowicie sztuczna.

Inna reguła selekcji daje to samo: jeśli przyjmujemy każdego, kto ma A > 1 lub B > 1 (29% populacji), korelacja w próbce wynosi −0,55. Ktoś, kto badałby tylko przyjętych, mógłby ogłosić, że „wysokie A szkodzi B”.

W praktyce

  • Zanim zinterpretujesz korelację, zapisz, jak dane trafiły do zbioru i co mogło je odfiltrować.
  • Nie trenuj modelu tylko na obiektach, które przeszły poprzedni etap (np. tylko na zatwierdzonych kredytach) bez korekty; model nauczy się fałszywych zależności.
  • W analizie przyczynowej nie dodawaj do modelu zmiennych będących skutkiem badanej przyczyny i wyniku — to warunkowanie na zderzaczu.
  • Sprawdź symulacją: rng.normal(size=(n, 2)), filtr, np.corrcoef — w minutę zobaczysz, jaką korelację tworzy twoja reguła selekcji.
  • Jeśli możesz, zbierz dane sprzed selekcji (np. odrzuconych kandydatów) albo modeluj mechanizm selekcji jawnie.

Najczęstsze pytania

Czym paradoks Berksona różni się od paradoksu Simpsona?
W paradoksie Simpsona związek fałszuje zmienna zakłócająca, którą trzeba uwzględnić. W paradoksie Berksona fałszywy związek powstaje właśnie dlatego, że uwzględniono (przez selekcję) zmienną będącą wspólnym skutkiem.
Czy paradoks Berksona dotyczy tylko szpitali?
Nie. Dotyczy każdej próbki wybranej na podstawie cech, które badasz: rekrutacji, publikacji, ocen produktów, danych z lejka sprzedażowego, modeli wybranych z rankingu.
Jak się przed nim bronić?
Znać mechanizm powstania próbki, narysować graf przyczynowy i nie warunkować na wspólnych skutkach. Najlepiej mieć dane z populacji przed selekcją.

Źródła

  • Joseph Berkson, „Limitations of the application of fourfold table analysis to hospital data”, Biometrics Bulletin 2(3), 1946, s. 47–53.
  • Judea Pearl, „Causality: Models, Reasoning, and Inference”, 2nd ed., Cambridge University Press, 2009.
  • Miguel A. Hernán, Sonia Hernández-Díaz, James M. Robins, „A structural approach to selection bias”, Epidemiology 15(5), 2004, s. 615–625.
  • Felix Elwert, Christopher Winship, „Endogenous selection bias: The problem of conditioning on a collider variable”, Annual Review of Sociology 40, 2014, s. 31–53.

Zobacz też