10 · Praktyka · 4 min czytania · aktualizacja
Skąd bierze się stronniczość modeli ML i jak mierzyć sprawiedliwość?
W skrócie
Model uczy się wzorców z danych historycznych, także niesprawiedliwych. Sprawiedliwość mierzy się, porównując decyzje i błędy w grupach.
Co to jest
Stronniczość (bias) modelu w sensie etycznym to systematycznie gorsze traktowanie pewnych grup ludzi — np. ze względu na płeć, pochodzenie czy wiek — przez decyzje oparte na predykcjach. Sprawiedliwość algorytmiczna (fairness) to zestaw definicji i metod, które pozwalają takie różnice zmierzyć i ograniczyć.
Nie chodzi tu o „bias” z kompromisu obciążenie–wariancja, tylko o skutki społeczne. Model nie musi „wiedzieć”, kto należy do jakiej grupy, by działać stronniczo: wystarczy, że uczy się z danych, w których historyczne decyzje były nierówne, albo z cech, które są pośrednikami (proxy) atrybutu chronionego, jak kod pocztowy.
Mechanizm — dlaczego tak działa
Uczenie nadzorowane odtwarza zależności z danych. Jeśli etykiety pochodzą z dawnych decyzji ludzi (kogo zatrudniono, komu dano kredyt), model uczy się tych decyzji razem z ich uprzedzeniami. Jeśli jakaś grupa jest w danych słabo reprezentowana, model myli się dla niej częściej, bo widział mniej przykładów. Jeśli etykieta mierzy cel nierówno (np. zatrzymania zamiast przestępstw), model dziedziczy błąd pomiaru.
Usunięcie atrybutu chronionego z cech zwykle nie pomaga. Informacja o płci czy pochodzeniu jest rozproszona w innych cechach — zawodzie, miejscu zamieszkania, historii zakupów — i model odtworzy ją pośrednio. Co więcej, bez tego atrybutu nie da się zmierzyć, czy model jest sprawiedliwy.
Definicje sprawiedliwości dzielą się na kilka rodzin. Parytet demograficzny: odsetek decyzji pozytywnych jest taki sam w grupach. Wyrównane szanse (equalized odds): w grupach są równe odsetki prawdziwie i fałszywie pozytywnych. Kalibracja w grupach: predykcja 70% oznacza 70% w każdej grupie. Kleinberg, Mullainathan i Raghavan (2017) oraz Chouldechova (2017) pokazali, że gdy częstości bazowe w grupach się różnią, kalibracji i równych odsetków błędów nie da się spełnić jednocześnie (poza modelem doskonałym). Wybór definicji jest więc decyzją wartościującą, nie techniczną.
Ostatnia pułapka to agregacja. Różnica widoczna w danych zbiorczych może zniknąć lub się odwrócić po podziale na podgrupy — to paradoks Simpsona. Odpowiedź na pytanie „czy to dyskryminacja?” wymaga modelu przyczynowego: które zmienne są uzasadnionym wyjaśnieniem różnicy, a które same są jej śladem.
Na przykładzie
Rekrutacja na studia magisterskie i doktoranckie w Berkeley w 1973 roku, sześć największych wydziałów. Przyjęto 1198 z 2691 mężczyzn (44,5%) i 557 z 1835 kobiet (30,4%). Stosunek tych odsetków to 0,68 — poniżej progu 0,8 z popularnej „reguły czterech piątych”, więc w ujęciu parytetu demograficznego wygląda to na wyraźną dyskryminację.
Po podziale na wydziały obraz się zmienia: w czterech z sześciu kobiety miały wyższy odsetek przyjęć, a na wydziale A aż 82,4% wobec 62,1% u mężczyzn. Różnicę zbiorczą tworzy wybór wydziałów: na dwa najłatwiejsze (A i B, ok. 63–64% przyjęć) trafiło 51,5% zgłoszeń mężczyzn, ale tylko 7,2% zgłoszeń kobiet, które aplikowały głównie na wydziały przyjmujące 6–35% kandydatów. Przy tym samym rozkładzie zgłoszeń dla obu płci odsetki wyniosłyby 38,7% dla mężczyzn i 43,0% dla kobiet. Bickel i współautorzy (1975) nie znaleźli na poziomie wydziałów dowodów dyskryminacji kobiet — ale pytanie, dlaczego kobiety kierowano ku najbardziej obleganym kierunkom, pozostaje pytaniem o sprawiedliwość, tylko na innym poziomie.
Dane: Przyjęcia na Berkeley 1973
W praktyce
- Zawsze raportuj metryki osobno dla grup: odsetek decyzji pozytywnych, czułość, odsetek fałszywie pozytywnych, kalibrację (
groupbyna predykcjach out-of-fold). - Biblioteka
fairlearn:MetricFrameliczy dowolne metryki per grupa,ThresholdOptimizerdobiera progi pod wybrane kryterium. - Sprawdź reprezentację grup w danych uczących i jakość etykiet w każdej z nich.
- Szukaj cech-pośredników: model przewidujący atrybut chroniony z pozostałych cech z wysokim AUC oznacza, że informacja i tak jest w danych.
- Wybór kryterium uzgodnij z interesariuszami i zapisz uzasadnienie; nie ma definicji neutralnej.
- Typowy błąd: usunięcie kolumny „płeć” i ogłoszenie, że model jest sprawiedliwy.
Najczęstsze pytania
- Czy model może być stronniczy, jeśli nie widzi atrybutu chronionego?
- Tak. Atrybut chroniony jest zwykle skorelowany z innymi cechami, a etykiety z przeszłości mogą zawierać nierówne decyzje. Model odtworzy te wzorce pośrednio. Do sprawdzenia sprawiedliwości atrybut jest wręcz potrzebny — przynajmniej w zbiorze ewaluacyjnym.
- Która definicja sprawiedliwości jest właściwa?
- Żadna nie jest uniwersalna. Parytet demograficzny pasuje, gdy różnice w danych uznajemy za skutek niesprawiedliwości; wyrównane szanse, gdy etykiety uznajemy za wiarygodne; kalibracja, gdy predykcje mają oznaczać to samo ryzyko dla każdego. Przy różnych częstościach bazowych trzeba wybierać.
- Czego uczy przypadek Berkeley?
- Że różnica w danych zbiorczych nie dowodzi dyskryminacji, a jej brak w podgrupach nie dowodzi sprawiedliwości. Trzeba zapytać, przez jakie mechanizmy powstaje różnica i które z nich uznajemy za uprawnione.
Źródła
- Bickel P. J., Hammel E. A., O'Connell J. W. „Sex Bias in Graduate Admissions: Data from Berkeley”, Science 187(4175), 1975.
- Barocas S., Hardt M., Narayanan A. „Fairness and Machine Learning: Limitations and Opportunities”, MIT Press 2023, https://fairmlbook.org
- Kleinberg J., Mullainathan S., Raghavan M. „Inherent Trade-Offs in the Fair Determination of Risk Scores”, ITCS 2017.
- Chouldechova A. „Fair prediction with disparate impact: A study of bias in recidivism prediction instruments”, Big Data 5(2), 2017.
- Hardt M., Price E., Srebro N. „Equality of Opportunity in Supervised Learning”, NeurIPS 2016.