Dział 04 · 31 haseł
Ocena modeli
Walidacja, przeuczenie, macierz pomyłek, precision i recall, ROC AUC, kalibracja: jak sprawdzić, czy model naprawdę działa.
- Zbiór treningowy, walidacyjny i testowy InteraktywneTrening służy do uczenia, walidacja do wyboru modelu i ustawień, a test do jednej uczciwej oceny na końcu. Każde podejrzenie testu psuje jego wartość.
- Zbiór walidacyjnyZbiór walidacyjny to odłożone dane, na których model się nie uczy, a które służą do wyboru ustawień. Przeuczenie widać jako lukę między nim a treningiem.
- Przeuczenie i niedouczenie InteraktywnePrzeuczony model zapamiętuje szum ze zbioru treningowego i gorzej działa na nowych danych, a niedouczony jest za prosty, by uchwycić nawet główny wzorzec.
- Złudzenie trafności treningowejWysoki wynik na zbiorze treningowym może być zapamiętaniem przykładów, a nie reguły. Prawdę o modelu mówi tylko wynik na danych, których model nie widział.
- Mały zbiór treningowy i 100% trafności InteraktywnePrzy kilku przykładach model dopasuje dowolne etykiety, więc idealny wynik treningowy nie mówi, czy poznał regułę. Wymiar VC klasyfikatora liniowego to d+1.
- Walidacja krzyżowa InteraktywneWalidacja krzyżowa dzieli dane na k części i każdą z nich po kolei traktuje jako zbiór walidacyjny. Daje stabilniejszą ocenę modelu niż jeden podział.
- Warianty walidacji krzyżowej InteraktywneWariant walidacji krzyżowej musi naśladować sposób, w jaki model spotka nowe dane: warstwowanie dla klas, grupy dla pacjentów, porządek czasu dla prognoz.
- Modele bazoweModel bazowy to najprostsze sensowne rozwiązanie, np. zawsze najczęstsza klasa. Bez niego nie wiadomo, czy wynik modelu jest dobry, czy tylko tak wygląda.
- Macierz pomyłek InteraktywneMacierz pomyłek zlicza, ile przykładów każdej prawdziwej klasy model przypisał do każdej klasy. Z niej wynikają trafność, precyzja, recall i inne metryki.
- Precyzja i recall InteraktywnePrecyzja mówi, jaka część alarmów modelu jest prawdziwa, a recall, jaką część prawdziwych przypadków model wykrył. Zwykle poprawa jednej psuje drugą.
- Recall (czułość) InteraktywneRecall (czułość) to odsetek prawdziwych przykładów danej klasy, które model rozpoznał. Fałszywe alarmy mierzy precyzja. Średnia recalli to balanced accuracy.
- Precyzja czy recall — co ważniejszeO wyborze między precyzją a recall decyduje koszt błędów: gdy droższe jest przeoczenie, liczy się recall, gdy fałszywy alarm — precyzja. Próg wynika z kosztów.
- Miara F1 InteraktywneF1 to średnia harmoniczna precyzji i recall. Jest wysoka tylko wtedy, gdy obie są wysokie, więc karze modele, które poświęcają jedną dla drugiej.
- Zbalansowana trafność (balanced accuracy)Balanced accuracy to średnia z recalli wszystkich klas. Przy niezbalansowanych klasach nie nagradza modelu, który zawsze wybiera klasę najczęstszą.
- Trafność czy zbalansowana trafnośćTrafność liczy odsetek wszystkich poprawnych odpowiedzi, a zbalansowana trafność uśrednia recall każdej klasy. Przy rzadkiej klasie tylko ta druga widzi kłopot.
- Próg decyzji InteraktywnePróg decyzji to reguła zamiany prawdopodobieństw na klasę. Próg 0,5 jest optymalny tylko przy równych kosztach pomyłek i tych samych proporcjach klas.
- ROC AUC (pole pod krzywą ROC) InteraktywneROC AUC to prawdopodobieństwo, że losowy przykład pozytywny dostanie wyższy wynik niż losowy negatywny. Zależy od kolejności wyników, nie od progu.
- Krzywa precyzja–recallKrzywa precyzja–recall pokazuje precyzję modelu przy każdym poziomie recall, czyli dla wszystkich progów naraz. Przy rzadkiej klasie mówi więcej niż ROC.
- ROC AUC czy PR AUCROC AUC nie zależy od częstości klasy pozytywnej i ocenia cały ranking. PR AUC spada razem z częstością i pokazuje, ile warte są alarmy przy rzadkiej klasie.
- Kalibracja modeluModel jest skalibrowany, gdy deklarowana pewność zgadza się z częstością trafień. Temperature scaling dzieli logity przez T z walidacji, nie zmieniając decyzji.
- Metryki dla wielu klas InteraktywneW klasyfikacji wieloklasowej precyzję, recall i F1 liczy się dla każdej klasy osobno i uśrednia. Sposób uśredniania decyduje, czy liczą się rzadkie klasy.
- Metryki regresji: MAE, RMSE, R² InteraktywneMAE mierzy przeciętny błąd, RMSE mocniej karze duże pomyłki, a R² mówi, jaką część zmienności celu model wyjaśnia w porównaniu z przewidywaniem średniej.
- Jak wybrać metrykę oceny modeluMetrykę dobiera się do decyzji: etykieta, ranking czy prawdopodobieństwo, koszty błędów i proporcje klas. Inna metryka to często inny zwycięski model.
- Analiza reszt InteraktywneReszty to różnice między wartością prawdziwą a przewidywaną. Ich wykres ujawnia nieliniowość, punkty wpływowe i zmienny rozrzut, których metryki nie pokażą.
- Krzywe uczenia InteraktywneKrzywa uczenia pokazuje wynik treningowy i walidacyjny modelu w zależności od liczby przykładów. Mówi, czy więcej danych pomoże, czy model jest za prosty.
- Krzywe walidacyjne InteraktywneKrzywa walidacyjna pokazuje wynik treningowy i walidacyjny w zależności od jednego hiperparametru. Widać, gdzie model jest za prosty, a gdzie przeuczony.
- Strojenie hiperparametrówStrojenie hiperparametrów to wybór ustawień modelu, których algorytm nie uczy się sam, na podstawie walidacji. Wynik zwycięzcy jest zawsze nieco zawyżony.
- Wpływ cechy InteraktywneWpływ cechy mówi, o ile zmienia się odpowiedź modelu po zmianie jednej cechy. W modelu liniowym to waga po standaryzacji, w innych — permutacja lub SHAP.
- Ważność permutacyjna cech InteraktywneWażność permutacyjna mierzy, o ile pogarsza się wynik modelu, gdy losowo przetasujemy wartości jednej cechy. Działa dla każdego modelu i na danych testowych.
- Zależność częściowa i krzywe ICEWykres zależności częściowej pokazuje, jak średnio zmienia się przewidywanie modelu wraz z jedną cechą. Krzywe ICE pokazują to osobno dla każdego przykładu.
- Wartości SHAP InteraktywneWartości SHAP rozkładają przewidywanie modelu dla jednego przykładu na wkłady cech, które sumują się do różnicy między tym przewidywaniem a średnią.