ML Atlas

11 · Prawa i prawdy · 3 min czytania · Interaktywne · aktualizacja

Na czym polega błąd stopy bazowej (base rate fallacy)?

W skrócie

Trafny test przy rzadkim zjawisku daje głównie fałszywe alarmy, bo zdrowych jest dużo więcej niż chorych. Dlaczego ludzie i modele o tym zapominają.

Co to jest

Oceniając, jak prawdopodobne jest coś po zobaczeniu dowodu, ludzie przeceniają sam dowód i pomijają to, jak częste było to zjawisko z góry (stopę bazową). Systematycznie opisali to Daniel Kahneman i Amos Tversky w 1973 roku, a nazwę „base-rate fallacy” spopularyzowała Maya Bar-Hillel w 1980 roku.

Klasyczna sytuacja: test na rzadką chorobę wykrywa 96% chorych i daje fałszywy alarm tylko u 1% zdrowych. Wynik pozytywny. Intuicja mówi „na 96% jestem chory”. Tymczasem jeśli choruje 1 osoba na 100, szansa wynosi około 50% — a przy 1 na 1000 — około 9%.

W uczeniu maszynowym to samo zjawisko nazywa się spadkiem precyzji przy niskiej częstości klasy pozytywnej. Model, który świetnie działał na zbalansowanym zbiorze, po wdrożeniu „w świat”, gdzie zdarzenia są rzadkie, zalewa użytkownika fałszywymi alarmami.

Mechanizm — dlaczego tak działa

Wynika to wprost z twierdzenia Bayesa: P(chory | wynik+) = P(wynik+ | chory) · P(chory) / P(wynik+). Czułość testu to tylko pierwszy czynnik. Drugi — P(chory), stopa bazowa — mnoży wszystko. Gdy jest mała, nawet doskonała czułość nie uratuje wyniku.

Najłatwiej zobaczyć to na liczbach naturalnych, a nie procentach. Weź 10 000 osób, choruje 1%, czyli 100. Test wykrywa 96 z nich. Wśród 9900 zdrowych 1% fałszywych alarmów to 99 osób. Pozytywnych wyników jest 195, a prawdziwie chorych wśród nich 96 — mniej niż połowa. Zdrowych jest tak dużo, że ich mały odsetek błędów przewyższa liczebnie chorych.

Dlaczego mózg to pomija? Kahneman i Tversky wiązali to z heurystyką reprezentatywności: oceniamy, jak bardzo dowód „pasuje” do hipotezy, a nie jak częsta jest hipoteza. Opis osoby brzmiący jak inżynier każe uznać ją za inżyniera, nawet gdy inżynierowie stanowią tylko 30% grupy. Gerd Gigerenzer i Ulrich Hoffrage pokazali w 1995 roku, że błąd wyraźnie maleje, gdy te same dane poda się jako liczebności („96 z 100”), a nie prawdopodobieństwa.

Zastrzeżenie: stopa bazowa musi dotyczyć właściwej populacji. Jeśli do lekarza trafia ktoś z objawami, częstość choroby w tej grupie jest wyższa niż w całym społeczeństwie i test ma wyższą wartość predykcyjną.

Na przykładzie

Breast Cancer Wisconsin: 569 guzów, w tym 212 złośliwych (37,3%). Regresja logistyczna (standaryzacja cech, 5-krotna walidacja krzyżowa, ziarno 0) wykrywa 203 z 212 złośliwych (czułość 95,8%) i myli tylko 3 z 357 łagodnych (swoistość 99,2%). W tym zbiorze 98,5% alarmów jest trafnych. Przenieśmy ten sam model do populacji badań przesiewowych: przy częstości 10% trafnych alarmów jest 92,7%, przy 1% — 53,5%, przy 0,1% — tylko 10,2%. Model się nie zmienił; zmieniła się stopa bazowa.

Titanic pokazuje drugą stronę. Wśród 342 ocalałych 39,8% to pasażerowie pierwszej klasy, a 34,8% — trzeciej. Wygląda na podobne szanse. Ale trzecia klasa stanowiła 55,1% pasażerów, a pierwsza 24,2%. Po uwzględnieniu tych proporcji przeżyło 63,0% pasażerów pierwszej klasy i 24,2% trzeciej.

Ta ilustracja działa w przeglądarce z włączonym JavaScriptem: przy częstości choroby 1%, czułości 90% i swoistości 90% tylko 9 ze 108 wyników dodatnich to chorzy (PPV 8,3%).

Dane: Titanic Breast Cancer Wisconsin (diagnostyka raka piersi)

W praktyce

  • Zawsze pytaj o częstość klasy pozytywnej tam, gdzie model będzie działał, nie w zbiorze treningowym.
  • Przeliczaj precyzję dla docelowej częstości: PPV = czułość·p / (czułość·p + (1 − swoistość)·(1 − p)).
  • W scikit-learn oglądaj confusion_matrix, precision_score i PrecisionRecallDisplay; sama roc_auc_score nie zależy od stopy bazowej i ukrywa problem.
  • Jeśli trenowałeś na danych z nadpróbkowaniem (SMOTE, class_weight), skoryguj prawdopodobieństwa do prawdziwej częstości przed wyborem progu.
  • Komunikuj wyniki liczebnościami: dla modelu z przykładu przy częstości 1%: „na 10 000 badanych 96 trafnych alarmów i 83 fałszywe”.

Najczęstsze pytania

Czym jest stopa bazowa?
To częstość zjawiska w populacji, zanim zobaczysz jakikolwiek dowód — np. odsetek chorych wśród badanych albo odsetek oszustw wśród transakcji. W twierdzeniu Bayesa to prawdopodobieństwo a priori.
Czy dobry model może mieć niską precyzję?
Tak. Czułość i swoistość opisują model, ale precyzja zależy też od stopy bazowej. Przy bardzo rzadkich zdarzeniach nawet 99% swoistości daje więcej fałszywych alarmów niż trafień.
Jak błąd stopy bazowej ma się do błędu prokuratora?
To ten sam mechanizm w sądzie: mylenie P(dowód | niewinny) z P(niewinny | dowód). Oba biorą się z pominięcia, ile osób z góry pasowało do każdej hipotezy.

Źródła

  • Daniel Kahneman, Amos Tversky, „On the psychology of prediction”, Psychological Review 80(4), 1973, s. 237–251.
  • Amos Tversky, Daniel Kahneman, „Judgment under Uncertainty: Heuristics and Biases”, Science 185(4157), 1974, s. 1124–1131.
  • Maya Bar-Hillel, „The base-rate fallacy in probability judgments”, Acta Psychologica 44, 1980, s. 211–233.
  • Gerd Gigerenzer, Ulrich Hoffrage, „How to improve Bayesian reasoning without instruction: Frequency formats”, Psychological Review 102(4), 1995, s. 684–704.

Zobacz też