Ścieżka nauki · średni · 14 kroków · ok. 56 min
Jak uczciwie ocenić model
Podział danych, model bazowy, walidacja krzyżowa, macierz pomyłek, precision i recall, próg decyzji, ROC AUC, kalibracja i wyciek danych — po kolei.
- Zbiór treningowy, walidacyjny i testowy4 min
Trening służy do uczenia, walidacja do wyboru modelu i ustawień, a test do jednej uczciwej oceny na końcu. Każde podejrzenie testu psuje jego wartość.
- Modele bazowe4 min
Model bazowy to najprostsze sensowne rozwiązanie, np. zawsze najczęstsza klasa. Bez niego nie wiadomo, czy wynik modelu jest dobry, czy tylko tak wygląda.
- Walidacja krzyżowa4 min
Walidacja krzyżowa dzieli dane na k części i każdą z nich po kolei traktuje jako zbiór walidacyjny. Daje stabilniejszą ocenę modelu niż jeden podział.
- Macierz pomyłek4 min
Macierz pomyłek zlicza, ile przykładów każdej prawdziwej klasy model przypisał do każdej klasy. Z niej wynikają trafność, precyzja, recall i inne metryki.
- Precyzja i recall4 min
Precyzja mówi, jaka część alarmów modelu jest prawdziwa, a recall, jaką część prawdziwych przypadków model wykrył. Zwykle poprawa jednej psuje drugą.
- Miara F14 min
F1 to średnia harmoniczna precyzji i recall. Jest wysoka tylko wtedy, gdy obie są wysokie, więc karze modele, które poświęcają jedną dla drugiej.
- Zbalansowana trafność (balanced accuracy)3 min
Balanced accuracy to średnia z recalli wszystkich klas. Przy niezbalansowanych klasach nie nagradza modelu, który zawsze wybiera klasę najczęstszą.
- Próg decyzji4 min
Próg decyzji to reguła zamiany prawdopodobieństw na klasę. Próg 0,5 jest optymalny tylko przy równych kosztach pomyłek i tych samych proporcjach klas.
- ROC AUC (pole pod krzywą ROC)4 min
ROC AUC to prawdopodobieństwo, że losowy przykład pozytywny dostanie wyższy wynik niż losowy negatywny. Zależy od kolejności wyników, nie od progu.
- Krzywa precyzja–recall4 min
Krzywa precyzja–recall pokazuje precyzję modelu przy każdym poziomie recall, czyli dla wszystkich progów naraz. Przy rzadkiej klasie mówi więcej niż ROC.
- Kalibracja modelu4 min
Model jest skalibrowany, gdy deklarowana pewność zgadza się z częstością trafień. Temperature scaling dzieli logity przez T z walidacji, nie zmieniając decyzji.
- Metryki regresji: MAE, RMSE, R²4 min
MAE mierzy przeciętny błąd, RMSE mocniej karze duże pomyłki, a R² mówi, jaką część zmienności celu model wyjaśnia w porównaniu z przewidywaniem średniej.
- Wyciek danych (data leakage)4 min
Wyciek danych to sytuacja, w której model w treningu lub walidacji dostaje informację niedostępną w chwili prawdziwej prognozy. Daje zawyżone wyniki.
- Jak wybrać metrykę oceny modelu5 min
Metrykę dobiera się do decyzji: etykieta, ranking czy prawdopodobieństwo, koszty błędów i proporcje klas. Inna metryka to często inny zwycięski model.