01 · Podstawy · 4 min czytania · aktualizacja
Czym jest wnioskowanie przyczynowe i jak odróżnić korelację od przyczynowości?
W skrócie
Wnioskowanie przyczynowe pyta, co się stanie po interwencji, a nie co z czym współwystępuje. Wymaga eksperymentu albo jawnych założeń o zakłóceniach.
Co to jest
Wnioskowanie przyczynowe (causal inference) to dział statystyki zajmujący się szacowaniem skutków interwencji: o ile zmieni się wynik, jeśli zmienimy daną zmienną, a nie tylko jak bardzo obie zmienne są ze sobą powiązane. Formalnie odróżnia prawdopodobieństwo warunkowe P(Y | X = x), czyli „co widzimy wśród tych, którzy mają x”, od P(Y | do(X = x)), czyli „co by się stało, gdyby wszystkim ustawić x”.
Intuicja: ludzie, którzy biorą witaminy, są średnio zdrowsi. Ale biorą je też częściej osoby zamożniejsze, aktywniejsze i dbające o dietę. Korelacja odpowiada na pytanie „kto bierze witaminy?”, a decyzja wymaga odpowiedzi na inne: „co się stanie, jeśli zacznę je brać?”. Modele uczenia maszynowego świetnie przewidują, ale przewidywanie to nie to samo co wiedza, którą dźwignię pociągnąć.
Mechanizm — dlaczego tak działa
Podstawowy problem: dla każdej jednostki widzimy tylko jeden wynik. W ramie potencjalnych wyników (Neyman, Rubin) każda osoba ma wynik Y(1) przy leczeniu i Y(0) bez niego, a efekt przyczynowy to Y(1) − Y(0). Jednego z nich nigdy nie obserwujemy — to wynik kontrfaktyczny. Wnioskowanie przyczynowe polega na rozsądnym uzupełnieniu brakującej połowy danych.
Porównanie grup leczonych i nieleczonych daje efekt przyczynowy tylko wtedy, gdy grupy są porównywalne pod każdym innym względem. Zmienna zakłócająca (confounder) to taka, która wpływa jednocześnie na przypisanie do grupy i na wynik — jak zamożność w przykładzie z witaminami. Tworzy ona korelację bez przyczynowości albo ukrywa prawdziwy efekt.
Złoty standard to randomizacja. Gdy o przydziale decyduje rzut monetą, żadna cecha — zmierzona ani niezmierzona — nie może być z nim powiązana, więc średnia różnica wyników jest nieobciążonym oszacowaniem efektu. Na tym opiera się badanie kliniczne i test A/B.
Bez eksperymentu trzeba przyjąć założenia. Jeśli zmierzyliśmy wszystkie zmienne zakłócające Z (brak ukrytych zakłóceń), efekt da się odzyskać przez standaryzację: P(Y | do(X = x)) = Σ_z P(Y | X = x, Z = z) · P(Z = z). Liczy się efekt w każdej warstwie Z, a potem uśrednia według rozkładu Z w całej populacji, a nie w grupie leczonych. Tę samą ideę realizują ważenie odwrotnością prawdopodobieństwa przydziału (propensity score), dopasowanie par i modele regresji z kontrolą zmiennych.
Kluczowe pytanie brzmi: co kontrolować? Grafy przyczynowe (DAG, Pearl) dają odpowiedź. Należy kontrolować zmienne zakłócające (wspólne przyczyny), ale nie mediatory (zmienne na ścieżce od X do Y — kontrola usuwa część efektu, który chcemy zmierzyć) ani zderzacze (wspólne skutki — kontrola tworzy fałszywą zależność, jak w paradoksie Berksona). „Dorzuć do regresji wszystkie dostępne zmienne” bywa więc błędem.
Gdy zmiennych zakłócających nie da się zmierzyć, stosuje się quasi-eksperymenty: zmienne instrumentalne, różnicę w różnicach, nieciągłość regresji. Każda metoda zastępuje randomizację innym założeniem, które trzeba uzasadnić wiedzą o dziedzinie — dane same nie powiedzą, która strzałka w którą stronę.
Na przykładzie
Berkeley 1973, sześć największych wydziałów: przyjęto 1198 z 2691 mężczyzn (44,5%) i 557 z 1835 kobiet (30,4%). Różnica 14 punktów procentowych wygląda na dyskryminację. Ale w czterech z sześciu wydziałów kobiety były przyjmowane częściej, np. na wydziale A 82,4% kobiet wobec 62,1% mężczyzn. Zmienną zakłócającą jest wybór wydziału: 51% mężczyzn aplikowało na łatwe wydziały A i B (przyjmowały ponad 63% kandydatów), a kobiet tylko 7%. Ponad 92% kobiet wybierało wydziały C–F, gdzie odsetek przyjęć wynosił od 6% do 35%.
Standaryzacja odpowiada na pytanie kontrfaktyczne: jaki byłby odsetek przyjęć, gdyby obie płcie aplikowały na wydziały w tych samych proporcjach (proporcjach wszystkich kandydatów)? Wychodzi 38,7% dla mężczyzn i 43,0% dla kobiet — kierunek różnicy się odwraca. Bickel i współautorzy (1975) wywnioskowali, że dane nie wskazują na dyskryminację przy decyzjach wydziałów. Zauważ, że to wniosek zależny od założenia: jeśli płeć wpływa na wybór wydziału przez czynniki, które same są skutkiem dyskryminacji, wydział jest częściowo mediatorem i odpowiedź zależy od pytania, które zadajemy.
Dane: Przyjęcia na Berkeley 1973
W praktyce
- Najpierw narysuj graf przyczynowy: co wpływa na przydział, co na wynik, co jest skutkiem obu. To on, a nie dostępność kolumn, mówi, co kontrolować.
DoWhy(identyfikacja i testy odporności),EconMLiCausalML(heterogeniczne efekty, meta-learnery),statsmodelsdo regresji z kontrolą zmiennych.- Ważenie propensity score: model
LogisticRegressionprzewiduje przydział z Z, wagi 1/p dla leczonych i 1/(1 − p) dla nieleczonych; sprawdź, czy po ważeniu grupy są zbalansowane. - Ważność cech w modelu (
feature_importances_, SHAP) mówi, czego model używa do przewidywania, a nie co jest przyczyną. - Typowy błąd: kontrolowanie zmiennej mierzonej po interwencji (mediatora lub zderzacza), co psuje oszacowanie zamiast je poprawiać.
Najczęstsze pytania
- Czy da się wnioskować o przyczynowości bez eksperymentu?
- Tak, ale tylko przy założeniach, których nie da się w pełni sprawdzić na danych — przede wszystkim, że zmierzono wszystkie istotne zmienne zakłócające. Dlatego wyniki obserwacyjne raportuje się z analizą wrażliwości: jak silne musiałoby być ukryte zakłócenie, by zmienić wniosek.
- Czym jest zmienna zakłócająca?
- To zmienna, która wpływa zarówno na to, kto dostaje interwencję, jak i na wynik. Tworzy korelację między nimi nawet wtedy, gdy interwencja nic nie robi. Na Berkeley taką rolę grał wybór wydziału.
- Czy model uczenia maszynowego może odkryć przyczyny?
- Sam z siebie nie. Model przewiduje, korzystając z dowolnych korelacji, także pozornych. Do pytań przyczynowych potrzebny jest eksperyment albo model przyczynowy z jawnymi założeniami; ML może pomóc w oszacowaniu jego składników.
Źródła
- Pearl, J., Glymour, M., Jewell, N. P. (2016). Causal Inference in Statistics: A Primer. Wiley.
- Hernán, M. A., Robins, J. M. (2020). Causal Inference: What If. Chapman & Hall/CRC.
- Rubin, D. B. (1974). "Estimating causal effects of treatments in randomized and nonrandomized studies". Journal of Educational Psychology, 66(5), 688–701.
- Bickel, P. J., Hammel, E. A., O'Connell, J. W. (1975). "Sex bias in graduate admissions: data from Berkeley". Science, 187(4175), 398–404.