ML Atlas

11 · Prawa i prawdy · 4 min czytania · Interaktywne · aktualizacja

Na czym polega błąd prokuratora w statystyce?

W skrócie

Mylenie prawdopodobieństwa dowodu przy niewinności z prawdopodobieństwem niewinności przy dowodzie. Dlaczego „1 na milion” nie znaczy „winny na 99,9999%”.

Co to jest

Błąd prokuratora to mylenie P(dowód | niewinny) z P(niewinny | dowód) — na przykład uznanie, że skoro przypadkowa zgodność DNA zdarza się raz na milion, to oskarżony jest niewinny z szansą jeden na milion. Nazwę wprowadzili William Thompson i Edward Schumann w 1987 roku, badając, jak sędziowie przysięgli interpretują dowody statystyczne.

Te dwa prawdopodobieństwa brzmią podobnie, ale mogą różnić się o rzędy wielkości. „Jak rzadko niewinna osoba pasuje do dowodu” to jedno pytanie. „Jak często osoba pasująca do dowodu jest niewinna” to drugie — i odpowiedź zależy od tego, ile osób w ogóle mogło pasować.

Ten sam błąd pojawia się poza sądem: w medycynie (fałszywie dodatni wynik testu), w nauce (wartość p mylona z prawdopodobieństwem, że hipoteza zerowa jest prawdziwa) i w ML (odsetek fałszywych alarmów mylony z odsetkiem alarmów fałszywych).

Mechanizm — dlaczego tak działa

Twierdzenie Bayesa wiąże oba prawdopodobieństwa: P(niewinny | dowód) = P(dowód | niewinny) · P(niewinny) / P(dowód). Odwrócenie warunku wymaga stopy bazowej — ile osób z góry mogło być sprawcą. Gdy potencjalnych podejrzanych jest wielu, nawet rzadka przypadkowa zgodność trafi się wielu niewinnym.

Prosty rachunek: profil DNA pasuje przypadkowo do 1 osoby na milion, a w mieście mieszka 10 milionów osób, z których każda teoretycznie mogła być sprawcą. Spodziewamy się około 10 przypadkowych zgodności plus prawdziwy sprawca. Jeśli jedynym dowodem jest zgodność, szansa, że konkretna pasująca osoba jest winna, to około 1 na 11, czyli 9% — a nie 99,9999%. Dopiero inne dowody (motyw, miejsce, czas) zawężają pulę.

Najgłośniejszy przykład to sprawa Sally Clark w Wielkiej Brytanii. W 1999 roku biegły zeznał, że szansa dwóch nagłych zgonów niemowląt w jednej zamożnej rodzinie to 1 do 73 milionów, co sugerowało winę matki. Popełniono dwa błędy naraz: pomnożono prawdopodobieństwa, jakby zgony były niezależne (ignorując czynniki genetyczne i środowiskowe), i przedstawiono rzadkość zdarzenia przy niewinności jako prawdopodobieństwo niewinności. Royal Statistical Society w 2001 roku publicznie zakwestionowała to rozumowanie; wyrok uchylono w 2003 roku. Właściwe pytanie brzmiało: co jest rzadsze — podwójny naturalny zgon czy podwójne zabójstwo dzieci przez matkę? Oba zdarzenia są skrajnie rzadkie.

Istnieje też lustrzany „błąd obrońcy” (Thompson i Schumann): skoro do profilu pasuje 10 osób w mieście, dowód jest bez znaczenia. Też źle — zawęzienie z 10 milionów do 11 to silny dowód, tylko niewystarczający sam w sobie.

Na przykładzie

Breast Cancer Wisconsin: regresja logistyczna (5-krotna walidacja krzyżowa, ziarno 0) daje fałszywy alarm u 3 z 357 guzów łagodnych, czyli P(alarm | łagodny) = 0,84%. Błąd prokuratora brzmiałby: „skoro tylko 0,84% łagodnych zmian wywołuje alarm, to po alarmie szansa, że zmiana jest łagodna, wynosi 0,84%”.

Policzmy dla populacji badań przesiewowych, w której złośliwe zmiany to 1%. Na 10 000 badanych: 100 zmian złośliwych, z czego model wykrywa około 96 (czułość 95,8%); 9900 łagodnych, z czego około 83 daje fałszywy alarm. Wśród 179 alarmów łagodnych jest 83, czyli P(łagodny | alarm) = 46,5%. Nie 0,84%, tylko prawie połowa.

Ta ilustracja działa w przeglądarce z włączonym JavaScriptem: przy częstości choroby 1%, czułości 90% i swoistości 90% tylko 9 ze 108 wyników dodatnich to chorzy (PPV 8,3%).

Dane: Breast Cancer Wisconsin (diagnostyka raka piersi)

W praktyce

  • Rozróżniaj w raportach odsetek fałszywych alarmów (FPR = FP / (FP + TN)) i odsetek fałszywych wśród alarmów (1 − precyzja = FP / (FP + TP)); w scikit-learn wyczytasz oba z confusion_matrix.
  • Wartość p to P(dane tak skrajne | H₀), a nie P(H₀ | dane). Nie pisz „na 95% hipoteza jest prawdziwa”.
  • Przy przeszukiwaniu dużej bazy (rekordy, twarze, transakcje) liczba przypadkowych trafień rośnie z rozmiarem bazy; oszacuj ją przed interpretacją trafienia.
  • Prezentuj dowody liczebnościami („na 10 000 osób: 96 trafnych i 83 fałszywe alarmy”), które chronią przed odwróceniem warunku.
  • Iloczyny prawdopodobieństw stosuj tylko wtedy, gdy zdarzenia są naprawdę niezależne.

Najczęstsze pytania

Czym różni się P(A | B) od P(B | A)?
P(A | B) to szansa A, gdy wiemy, że zaszło B; P(B | A) — odwrotnie. Prawie wszyscy papieże są mężczyznami, ale prawie żaden mężczyzna nie jest papieżem. Przejście między nimi wymaga stopy bazowej.
Czy błąd prokuratora to to samo co błąd stopy bazowej?
To ten sam mechanizm: ignorowanie, ilu kandydatów z góry pasowało do hipotezy. Nazwa „błąd prokuratora” odnosi się do kontekstu sądowego, a „błąd stopy bazowej” do ogólnego wnioskowania.
Czy wartość p to prawdopodobieństwo, że wynik jest przypadkowy?
Nie. Wartość p mówi, jak rzadkie byłyby takie dane, gdyby hipoteza zerowa była prawdziwa. Prawdopodobieństwo hipotezy zerowej po zobaczeniu danych wymaga dodatkowo prawdopodobieństwa a priori.

Źródła

  • William C. Thompson, Edward L. Schumann, „Interpretation of statistical evidence in criminal trials: The prosecutor’s fallacy and the defense attorney’s fallacy”, Law and Human Behavior 11(3), 1987, s. 167–187.
  • Colin Aitken, Franco Taroni, „Statistics and the Evaluation of Evidence for Forensic Scientists”, 2nd ed., Wiley, 2004.
  • Gerd Gigerenzer, „Calculated Risks: How to Know When Numbers Deceive You”, Simon & Schuster, 2002.
  • Royal Statistical Society, oświadczenie w sprawie statystyki w procesie Sally Clark, Londyn 2001.

Zobacz też