04 · Ocena · 4 min czytania · aktualizacja
Co to jest model bazowy (baseline) i dlaczego trzeba go policzyć przed właściwym modelem?
W skrócie
Model bazowy to najprostsze sensowne rozwiązanie, np. zawsze najczęstsza klasa. Bez niego nie wiadomo, czy wynik modelu jest dobry, czy tylko tak wygląda.
Co to jest
Model bazowy (baseline) to najprostsze rozsądne rozwiązanie problemu, z którym porównuje się każdy bardziej złożony model. W klasyfikacji to zwykle przewidywanie zawsze najczęstszej klasy, w regresji — przewidywanie średniej lub mediany, w szeregach czasowych — powtórzenie ostatniej wartości. Mocniejszym punktem odniesienia jest prosta reguła ekspercka albo model liniowy z kilkoma cechami.
Intuicja: „trafność 85%” brzmi dobrze, dopóki nie dowiesz się, że 84% przykładów należy do jednej klasy. Model bazowy zamienia surową liczbę w odpowiedź na właściwe pytanie: o ile mój model jest lepszy od rozwiązania, które nic nie kosztuje?
Mechanizm — dlaczego tak działa
Każda metryka ma swoje „zero”, które rzadko leży w zerze. Trafność modelu przewidującego zawsze najczęstszą klasę równa się jej udziałowi w danych. R² modelu przewidującego średnią wynosi zero z definicji, ale MAE już nie — ma konkretną wartość w jednostkach celu. F1 modelu oznaczającego wszystko jako pozytywne zależy od częstości klasy. Bez policzenia tych wartości nie da się ocenić, czy wynik jest postępem.
Modele bazowe wychwytują też błędy. Jeśli złożona sieć wypada gorzej od średniej, to prawie na pewno błąd w potoku: przesunięte etykiety, zła normalizacja, przeciek w drugą stronę. Jeśli wypada podejrzanie lepiej od każdej sensownej reguły, warto szukać przecieku danych. Model bazowy działa jak kalibracja przyrządu przed pomiarem.
Holte w 1993 roku pokazał, że reguły oparte na jednej cesze (1R) osiągają na wielu popularnych wówczas zbiorach trafność zaledwie o kilka punktów niższą niż ówczesne drzewa decyzyjne. Wniosek przetrwał: znaczna część sygnału w wielu problemach mieści się w jednej lub dwóch cechach, a złożony model dokłada stosunkowo niewiele. Warto wiedzieć, ile dokłada, zanim zapłaci się za niego utrzymaniem i nieprzejrzystością.
Dobry zestaw punktów odniesienia ma kilka szczebli: trywialny (najczęstsza klasa, średnia), losowy z zachowaniem proporcji klas, prosta reguła dziedzinowa i prosty model statystyczny (regresja liniowa lub logistyczna). Dopiero na tym tle widać, ile wnosi każdy krok złożoności. Model bazowy ocenia się dokładnie tak samo jak model właściwy — na tym samym zbiorze testowym lub w tych samych foldach.
Na przykładzie
Zbiór Titanic zawiera 891 pasażerów, z których przeżyło 38,4%. Podzieliłem go warstwowo 75/25 (random_state=0; 668 treningowych, 223 testowych), używając cech: klasa, płeć, wiek (brakujące uzupełnione medianą 28 lat), liczba rodzeństwa/małżonków, rodziców/dzieci i opłata. Przewidywanie „nikt nie przeżył” daje na teście 61,4% trafności; losowanie z proporcjami klas — 52,0%. Reguła „przeżywają kobiety” (w treningu przeżyło 74,9% kobiet i 18,5% mężczyzn) osiąga 77,1%.
Regresja logistyczna na wszystkich sześciu cechach dała na tym samym teście 76,7% — mniej niż jednolinijkowa reguła. Las losowy (300 drzew) osiągnął 80,7%, czyli o 3,6 punktu więcej niż reguła: to osiem dodatkowych poprawnych decyzji na 223 pasażerów. W 5-krotnej walidacji krzyżowej na całym zbiorze obraz jest podobny: najczęstsza klasa 61,6%, reguła płci 78,7%, regresja logistyczna 79,2%, las losowy 80,4%. Bez modeli bazowych wynik 80% wyglądałby jak 80 punktów postępu; naprawdę to kilka punktów ponad regułę, którą zna każdy, kto słyszał „najpierw kobiety i dzieci”.
Dane: Titanic
W praktyce
DummyClassifier(strategy='most_frequent' | 'stratified' | 'prior' | 'uniform')iDummyRegressor(strategy='mean' | 'median' | 'quantile')zsklearn.dummy; oceniaj je tym samymcross_val_scoreco model.- Dla szeregów czasowych bazą jest prognoza naiwna (ostatnia wartość) lub sezonowo naiwna (wartość sprzed okresu) — wiele złożonych modeli jej nie pokonuje.
- Prostą regułę ekspercką zakoduj jako funkcję i policz dla niej te same metryki.
- Raportuj poprawę względem bazy, np. „błąd MAE mniejszy o 23% niż przewidywanie średniej” albo zbalansowaną trafność, w której baza ma z definicji 50% przy dwóch klasach.
- W NLP i wizji silnymi bazami są: regresja logistyczna na TF-IDF i model wstępnie wytrenowany bez dostrajania.
- Typowy błąd: porównywanie z modelem bazowym ocenionym na innym podziale albo na zbiorze treningowym.
Najczęstsze pytania
- Jaki model bazowy wybrać?
- Kilka naraz: trywialny (pokazuje „zero” metryki), prostą regułę dziedzinową (pokazuje, ile wie ekspert bez ML) i prosty model liniowy (pokazuje, ile daje uczenie maszynowe bez złożoności). Każdy odpowiada na inne pytanie.
- Co, jeśli mój model nie pokonuje bazy?
- Najpierw szukaj błędu w potoku: etykiety, przetwarzanie, podział danych. Jeśli go nie ma, możliwe, że w cechach po prostu nie ma więcej sygnału — wtedy prosta reguła jest najlepszym wdrożeniem, tańszym i łatwiejszym do wyjaśnienia.
- Czy model bazowy może być zbyt mocny?
- Nie w sensie oceny — mocna baza to uczciwsza poprzeczka. Problem pojawia się, gdy baza korzysta z informacji niedostępnej w momencie przewidywania, np. z danych z przyszłości; wtedy jest równie nieuczciwa jak model z przeciekiem.
Źródła
- Holte R. C. (1993). Very Simple Classification Rules Perform Well on Most Commonly Used Datasets. Machine Learning, 11(1).
- Géron A. „Hands-On Machine Learning with Scikit-Learn, Keras, and TensorFlow”, 3rd ed., O’Reilly 2022, rozdz. 3 (Classification — Measuring Accuracy Using Cross-Validation).
- Hyndman R. J., Athanasopoulos G. „Forecasting: Principles and Practice”, 3rd ed., OTexts 2021, rozdz. 5.2 (Some simple forecasting methods) — https://otexts.com/fpp3/
- Dokumentacja scikit-learn: Dummy estimators — https://scikit-learn.org/stable/modules/model_evaluation.html#dummy-estimators