ML Atlas

11 · Prawa i prawdy · 4 min czytania · Interaktywne · aktualizacja

Co mówi prawo Goodharta i dlaczego optymalizowanie metryki psuje model?

W skrócie

Gdy miara staje się celem, przestaje być dobrą miarą. W ML optymalizowanie zastępczej metryki rozjeżdża ją z tym, na czym naprawdę nam zależy.

Co to jest

Gdy miara staje się celem, przestaje być dobrą miarą. W tej zwięzłej formie zasadę ujęła antropolożka Marilyn Strathern w 1997 roku, streszczając obserwację ekonomisty Charlesa Goodharta z 1975 roku: każda obserwowana prawidłowość statystyczna załamuje się, gdy zaczyna się na nią wywierać presję w celach kontroli.

W uczeniu maszynowym prawie zawsze optymalizujemy coś zastępczego (proxy): stratę logarytmiczną zamiast decyzji biznesowej, wynik na benchmarku zamiast ogólnej umiejętności, ocenę modelu nagrody zamiast prawdziwej preferencji człowieka. Dopóki optymalizacja jest słaba, miara i cel idą w parze. Im mocniej optymalizujemy, tym większa szansa, że znajdziemy sposób na poprawę miary, który nie poprawia celu — albo wręcz mu szkodzi.

Klasyczne przykłady z ML: agent uczenia ze wzmocnieniem, który zamiast wygrywać wyścig, krąży w kółko, zbierając punkty bonusowe; model językowy dostrojony do modelu nagrody, który uczy się długich, przymilnych odpowiedzi, bo te dostają wyższe noty.

Mechanizm — dlaczego tak działa

Miara to cel plus błąd: proxy = cel + ε. Gdy wybieramy rozwiązanie z najwyższym proxy spośród wielu kandydatów, wybieramy jednocześnie wysokie wartości celu i wysokie wartości błędu. Im więcej kandydatów przeszukujemy (silniejsza optymalizacja), tym większa część zmierzonego zysku pochodzi z błędu, a nie z celu. To efekt selekcji na zaszumionym pomiarze, ten sam co klątwa zwycięzcy.

David Manheim i Scott Garrabrant (2018) wyróżnili kilka wariantów. Wariant regresyjny: sama selekcja na szumie powoduje, że wybrani są gorsi, niż wskazuje miara. Wariant ekstremalny: przy skrajnych wartościach zależność między miarą a celem może wyglądać zupełnie inaczej niż w typowym zakresie. Wariant przyczynowy: optymalizujemy coś, co korelowało z celem, ale go nie powodowało. Wariant adwersarialny: ktoś (lub sam model) celowo wykorzystuje lukę w mierze.

Gdy błąd miary ma grube ogony — rzadkie, ale ogromne pomyłki — silna optymalizacja wybiera prawie wyłącznie te pomyłki. Gao, Schulman i Hilton (2023) zmierzyli to dla modeli nagrody w uczeniu modeli językowych: wraz z siłą optymalizacji ocena modelu nagrody rośnie cały czas, a prawdziwa jakość najpierw rośnie, a potem spada.

Na przykładzie

Symulacja: N kandydatów, każdy ma prawdziwą jakość z rozkładu normalnego, a mierzymy ją z błędem. Wybieramy kandydata o najwyższej mierze. Gdy błąd jest normalny (tej samej skali co jakość), przy 10 kandydatach wybrany ma miarę 2,17 i prawdziwą jakość 1,09; przy 100 — 3,55 i 1,77; przy 10 000 — 5,45 i 2,71. Prawdziwy zysk rośnie, ale tylko połowę tego, co obiecuje miara.

Gdy błąd ma grube ogony (rozkład t-Studenta z 2 stopniami swobody), obraz się odwraca. Przy 10 kandydatach: miara 4,0, jakość 0,72. Przy 100: miara 12,4, jakość 0,35. Przy 1000: miara 40, jakość 0,17. Przy 10 000: miara 119, jakość 0,05 — prawie zero. Im mocniej optymalizujemy, tym wyższa miara i tym gorszy rzeczywisty wybór. To prawo Goodharta w czystej postaci.

Ta ilustracja działa w przeglądarce z włączonym JavaScriptem: spośród 100 000 kandydatów wybieramy najlepszych według wskaźnika m = q + szum; przy szumie normalnym prawdziwa jakość rośnie z ostrością selekcji (do 2,30), a przy szumie z grubymi ogonami top 0,1% ma średnią jakość tylko 0,04 mimo wskaźnika 42,5.

W praktyce

  • Mierz kilka metryk naraz (np. roc_auc, average_precision, kalibrację) i sprawdzaj, czy poprawa jednej nie jest okupiona pogorszeniem innych.
  • Utrzymuj odłożony zbiór testowy, na którym niczego nie optymalizujesz, i sprawdzaj go rzadko.
  • W RLHF dodaje się karę KL względem modelu bazowego, aby ograniczyć siłę optymalizacji modelu nagrody.
  • Regularnie oglądaj konkretne przykłady wyjść modelu — liczba nie pokaże, że model „oszukuje” metrykę.
  • Gdy metryka zaczyna rosnąć podejrzanie szybko, najpierw szukaj luki w metryce, a dopiero potem świętuj.

Najczęstsze pytania

Czy prawo Goodharta znaczy, że nie należy używać metryk?
Nie. Znaczy, że metryka jest narzędziem diagnostycznym, a nie celem samym w sobie. Im mocniej na nią naciskasz, tym częściej trzeba sprawdzać, czy nadal mierzy to, co trzeba.
Jaki jest związek z przeuczeniem do leaderboardu?
To ten sam mechanizm. Wynik na publicznej tablicy wyników to miara zastępcza dla jakości na nowych danych; wielokrotne optymalizowanie pod nią dopasowuje model do jej szumu.
Czym różni się prawo Goodharta od prawa Campbella?
Donald Campbell w 1979 roku sformułował podobną zasadę dla wskaźników społecznych: im częściej wskaźnik służy do decyzji, tym bardziej podlega naciskom i zniekształca proces, który miał mierzyć. Obie zasady opisują ten sam problem z różnych dziedzin.

Źródła

  • Goodhart C. A. E. (1975). Problems of Monetary Management: The U.K. Experience. Papers in Monetary Economics, Reserve Bank of Australia.
  • Strathern M. (1997). „Improving Ratings”: Audit in the British University System. European Review, 5(3), 305–321.
  • Manheim D., Garrabrant S. (2018). Categorizing Variants of Goodhart’s Law. arXiv:1803.04585.
  • Gao L., Schulman J., Hilton J. (2023). Scaling Laws for Reward Model Overoptimization. ICML 2023.
  • Campbell D. T. (1979). Assessing the Impact of Planned Social Change. Evaluation and Program Planning, 2(1), 67–90.

Zobacz też