11 · Prawa i prawdy · 4 min czytania · aktualizacja
Co znaczy zdanie „wszystkie modele są błędne, ale niektóre są użyteczne”?
W skrócie
Każdy model jest uproszczeniem i w jakimś sensie fałszywy. Pytanie nie brzmi „czy jest prawdziwy”, tylko „czy jest wystarczająco dobry do tego celu”.
Co to jest
Wszystkie modele są błędne, ale niektóre są użyteczne. Myśl tę rozwijał statystyk George E. P. Box: w artykule „Science and Statistics” z 1976 roku napisał, że skoro wszystkie modele są błędne, naukowiec nie może uzyskać „poprawnego” modelu przez nadmierne dopracowanie; słynne sformułowanie z „użytecznością” pojawiło się w jego pracy z 1979 roku.
Model to mapa, a nie teren. Regresja liniowa zakłada, że zależność jest prostą linią z normalnym szumem; drzewo — że świat dzieli się na prostokąty; sieć neuronowa — że funkcja jest gładka tam, gdzie nie ma danych. Żadne z tych założeń nie jest dokładnie prawdziwe. Mimo to modele przewidują, wyjaśniają i pomagają podejmować decyzje.
Zasada przesuwa pytanie z „czy model jest prawdziwy?” na „czy jest wystarczająco dobry do konkretnego celu i gdzie przestaje działać?”.
Mechanizm — dlaczego tak działa
Rzeczywistość ma nieskończenie wiele szczegółów, a model ma skończenie wiele parametrów i skończenie wiele danych do ich oszacowania. Każdy model musi więc coś pominąć. Pytanie praktyczne brzmi, czy pominięte elementy są małe w porównaniu z tym, co nas interesuje. Prawa Newtona są „błędne” wobec teorii względności, ale do budowy mostu wystarczają z ogromnym zapasem.
Box podkreślał, że trzeba wiedzieć, jak model jest błędny. Analiza reszt, testy na danych z innych warunków, sprawdzanie założeń — to narzędzia do mapowania granic przydatności. Błąd systematyczny w resztach mówi, czego model nie uchwycił; działanie poza zakresem danych treningowych jest miejscem, gdzie „użyteczny” model najszybciej staje się szkodliwy.
Z tej zasady wynika też skromność wobec interpretacji. Jeśli wiele różnych modeli przewiduje równie dobrze (efekt Rashomon), żaden z nich nie jest „tym prawdziwym”. Breiman w 2001 roku przeciwstawił kulturę modelowania danych (zakładamy mechanizm i szacujemy parametry) kulturze modelowania algorytmicznego (oceniamy przede wszystkim trafność prognoz). Zasada Boxa ostrzega przed pomyleniem dopasowanego modelu ze światem w obu tych kulturach.
Zastrzeżenie: zdanie bywa nadużywane jako wymówka dla złych modeli. „Wszystkie modele są błędne” nie znaczy, że wszystkie są jednakowo błędne — chodzi o świadome zarządzanie błędem, a nie o jego akceptację.
Na przykładzie
Palmer Penguins (342 pingwiny z pełnymi pomiarami). Prosta regresja masy ciała względem długości płetwy: każdy milimetr płetwy to średnio 49,7 g masy, R² = 0,76 (w 10-krotnej walidacji krzyżowej 0,75), błąd typowy (RMSE) 393 g przy odchyleniu standardowym masy 801 g. Model jest prosty i wyraźnie użyteczny: zmniejsza niepewność o połowę.
Jest też ewidentnie błędny. Średnia reszta dla pingwinów białobrewych (Chinstrap) wynosi −216 g — model systematycznie przeszacowuje ich masę — a dla Adelie +44 g i Gentoo +66 g. Dodanie gatunku podnosi R² do 0,78 i obniża RMSE do 373 g, więc model staje się mniej błędny, choć nadal nie prawdziwy. A poza danymi traci sens całkowicie: dla płetwy długości 0 mm przewiduje masę −5781 g, dla 300 mm — 9125 g, podczas gdy w danych płetwy mają od 172 do 231 mm.
Dane: Palmer Penguins (pingwiny z Antarktydy)
W praktyce
- Zawsze oglądaj reszty (
residuals = y - model.predict(X)) w podziale na grupy i zakresy cech — systematyczny wzór pokazuje, jak model jest błędny. - Zapisuj zakres danych treningowych i ostrzegaj (lub odmawiaj prognozy) poza nim.
- Oceniaj model względem celu: jaki błąd jest akceptowalny dla decyzji, którą wspiera, a nie tylko jaki ma R² lub AUC.
- Monitoruj model po wdrożeniu — świat się zmienia i model użyteczny wczoraj może przestać być użyteczny jutro.
- Porównuj z prostym punktem odniesienia (
DummyRegressor): użyteczność to poprawa względem czegoś, nie liczba sama w sobie.
Najczęstsze pytania
- Skoro wszystkie modele są błędne, po co je budować?
- Bo przybliżona odpowiedź jest zwykle znacznie lepsza niż brak odpowiedzi. Model pozwala przewidywać, porównywać scenariusze i podejmować decyzje szybciej i spójniej niż intuicja.
- Jak ocenić, czy model jest wystarczająco dobry?
- Zestaw jego błąd z kosztem błędnych decyzji i z alternatywą (prostszy model, ekspert, obecna praktyka). Sprawdź też, czy działa na danych z innych warunków niż treningowe.
- Czy duże modele językowe też podlegają tej zasadzie?
- Tak. Są bardzo użyteczne, ale ich odpowiedzi są statystycznym przybliżeniem języka, a nie wiedzą o świecie. Halucynacje to jedna z widocznych form tego, że i ten model jest „błędny”.
Źródła
- Box G. E. P. (1976). Science and Statistics. Journal of the American Statistical Association, 71(356), 791–799.
- Box G. E. P. (1979). Robustness in the Strategy of Scientific Model Building. W: Launer R. L., Wilkinson G. N. (red.), Robustness in Statistics. Academic Press.
- Breiman L. (2001). Statistical Modeling: The Two Cultures. Statistical Science, 16(3), 199–231.
- Gorman K. B., Williams T. D., Fraser W. R. (2014). Ecological Sexual Dimorphism and Environmental Variability within a Community of Antarctic Penguins (Genus Pygoscelis). PLOS ONE, 9(3), e90081.