ML Atlas

Dział 10 · 15 haseł

Praktyka: od notatnika do produkcji

Przepływ pracy, wyciek danych, strojenie hiperparametrów, ensembling, konkursy Kaggle, wdrożenie i dryf danych.

  1. Przebieg projektu uczenia maszynowegoProjekt ML to pętla: określ problem i metrykę, zbuduj punkt odniesienia, waliduj uczciwie, poprawiaj małymi krokami, a potem wdrażaj i monitoruj.
  2. Formułowanie problemu MLFormułowanie problemu to decyzja, co dokładnie przewidujemy, na jakich danych dostępnych w chwili predykcji i jaką metryką mierzymy sukces modelu.
  3. Jak wybrać model uczenia maszynowegoNie ma modelu najlepszego zawsze. Zacznij od punktu odniesienia i modelu liniowego, dodaj las lub boosting, a wybór rozstrzygnij walidacją krzyżową.
  4. Ile danych potrzeba do uczenia modeluNie ma uniwersalnej liczby. Odpowiada krzywa uczenia: gdy wynik wciąż rośnie z liczbą przykładów, więcej danych pomoże; gdy stoi, zmień model lub cechy.
  5. Pipeline w scikit-learn InteraktywnePipeline łączy przetwarzanie danych i model w jeden obiekt, dzięki czemu każdy krok uczy się tylko na danych uczących, a walidacja nie przepuszcza wycieku.
  6. Powtarzalność eksperymentów MLPowtarzalność to możliwość odtworzenia wyniku: te same dane, kod, wersje bibliotek i ziarna losowości, a także raport rozrzutu wyniku między ziarnami.
  7. Debugowanie modeli MLDebugowanie modelu to seria testów kontrolnych: baseline, przeuczenie małej próbki, przetasowane etykiety, krzywe uczenia i analiza błędów.
  8. Przeuczenie modelu — lista kontrolnaLista kontrolna przeuczenia: luka trening–walidacja, przeciek w przetwarzaniu, duplikaty i grupy, zbyt wiele prób na walidacji i test na losowych etykietach.
  9. Jak pracować w konkursach KagglePraca na Kaggle to pętla: zrozum metrykę, zbuduj walidację podobną do testu, wyślij prosty baseline, ulepszaj według lokalnej CV, nie rankingu publicznego.
  10. Lokalna CV a ranking publiczny InteraktywneRanking publiczny liczy się na małej części testu i jest zaszumiony, a lokalna CV korzysta z większej próby. Ostateczny model wybieraj według CV, nie rankingu.
  11. Zespoły modeli i stacking InteraktywneZespół modeli uśrednia lub łączy predykcje kilku modeli. Działa, gdy modele mylą się w różnych miejscach, a stacking uczy się wag na predykcjach out-of-fold.
  12. Wdrożenie modelu MLWdrożenie to przeniesienie modelu z notebooka do systemu, który podejmuje decyzje: zapis z przetwarzaniem, API lub wsad, walidacja wejścia, wersje i monitoring.
  13. Monitoring i dryf danychDryf to zmiana rozkładu danych lub zależności cech od celu po wdrożeniu. Monitoring śledzi wejścia, predykcje i metryki, zanim jakość po cichu spadnie.
  14. Sprawiedliwość i stronniczość modeliModel uczy się wzorców z danych historycznych, także niesprawiedliwych. Sprawiedliwość mierzy się, porównując decyzje i błędy w grupach.
  15. Historia uczenia maszynowegoOd neuronu McCullocha i Pittsa (1943) przez perceptron, zimy AI i propagację wsteczną po AlexNet, Transformera i ChatGPT, czyli najważniejsze daty i ich sens.

Inne działy

01 Podstawy02 Dane03 Nadzorowane04 Ocena05 Bez nadzoru06 Sieci07 Architektury08 LLM09 Wzmocnienie11 Prawa i prawdy