ML Atlas

Ścieżka nauki · średni · 14 kroków · ok. 56 min

Jak uczciwie ocenić model

Podział danych, model bazowy, walidacja krzyżowa, macierz pomyłek, precision i recall, próg decyzji, ROC AUC, kalibracja i wyciek danych — po kolei.

  1. Zbiór treningowy, walidacyjny i testowy4 min

    Trening służy do uczenia, walidacja do wyboru modelu i ustawień, a test do jednej uczciwej oceny na końcu. Każde podejrzenie testu psuje jego wartość.

  2. Modele bazowe4 min

    Model bazowy to najprostsze sensowne rozwiązanie, np. zawsze najczęstsza klasa. Bez niego nie wiadomo, czy wynik modelu jest dobry, czy tylko tak wygląda.

  3. Walidacja krzyżowa4 min

    Walidacja krzyżowa dzieli dane na k części i każdą z nich po kolei traktuje jako zbiór walidacyjny. Daje stabilniejszą ocenę modelu niż jeden podział.

  4. Macierz pomyłek4 min

    Macierz pomyłek zlicza, ile przykładów każdej prawdziwej klasy model przypisał do każdej klasy. Z niej wynikają trafność, precyzja, recall i inne metryki.

  5. Precyzja i recall4 min

    Precyzja mówi, jaka część alarmów modelu jest prawdziwa, a recall, jaką część prawdziwych przypadków model wykrył. Zwykle poprawa jednej psuje drugą.

  6. Miara F14 min

    F1 to średnia harmoniczna precyzji i recall. Jest wysoka tylko wtedy, gdy obie są wysokie, więc karze modele, które poświęcają jedną dla drugiej.

  7. Zbalansowana trafność (balanced accuracy)3 min

    Balanced accuracy to średnia z recalli wszystkich klas. Przy niezbalansowanych klasach nie nagradza modelu, który zawsze wybiera klasę najczęstszą.

  8. Próg decyzji4 min

    Próg decyzji to reguła zamiany prawdopodobieństw na klasę. Próg 0,5 jest optymalny tylko przy równych kosztach pomyłek i tych samych proporcjach klas.

  9. ROC AUC (pole pod krzywą ROC)4 min

    ROC AUC to prawdopodobieństwo, że losowy przykład pozytywny dostanie wyższy wynik niż losowy negatywny. Zależy od kolejności wyników, nie od progu.

  10. Krzywa precyzja–recall4 min

    Krzywa precyzja–recall pokazuje precyzję modelu przy każdym poziomie recall, czyli dla wszystkich progów naraz. Przy rzadkiej klasie mówi więcej niż ROC.

  11. Kalibracja modelu4 min

    Model jest skalibrowany, gdy deklarowana pewność zgadza się z częstością trafień. Temperature scaling dzieli logity przez T z walidacji, nie zmieniając decyzji.

  12. Metryki regresji: MAE, RMSE, R²4 min

    MAE mierzy przeciętny błąd, RMSE mocniej karze duże pomyłki, a R² mówi, jaką część zmienności celu model wyjaśnia w porównaniu z przewidywaniem średniej.

  13. Wyciek danych (data leakage)4 min

    Wyciek danych to sytuacja, w której model w treningu lub walidacji dostaje informację niedostępną w chwili prawdziwej prognozy. Daje zawyżone wyniki.

  14. Jak wybrać metrykę oceny modelu5 min

    Metrykę dobiera się do decyzji: etykieta, ranking czy prawdopodobieństwo, koszty błędów i proporcje klas. Inna metryka to często inny zwycięski model.

Inne ścieżki

Uczenie maszynowe od zeraJak uczy się sieć neuronowaModele językowe i transformeryDane tabelaryczne i Kaggle