Dział 03 · 26 haseł
Uczenie nadzorowane
Regresja liniowa i logistyczna, k najbliższych sąsiadów, drzewa, lasy i boosting: modele, które uczą się z par „przykład → odpowiedź”.
- Czym jest uczenie maszynoweUczenie maszynowe to budowanie programów, które regułę wyprowadzają z przykładów, zamiast dostać ją od programisty. Liczy się trafność na nowych danych.
- Uczenie nadzorowane a nienadzorowaneW uczeniu nadzorowanym model dostaje przykłady z poprawnymi odpowiedziami, w nienadzorowanym tylko surowe dane i sam szuka w nich struktury.
- Regresja liniowa InteraktywneRegresja liniowa przewiduje liczbę jako ważoną sumę cech plus stałą. Wagi dobiera metodą najmniejszych kwadratów, a każda mówi o wpływie cechy.
- Metoda najmniejszych kwadratów InteraktywneMetoda najmniejszych kwadratów dobiera parametry modelu tak, by suma kwadratów błędów była minimalna. Ma wzór zamknięty, ale jest wrażliwa na odstające punkty.
- Funkcja straty (loss) InteraktywneFunkcja straty to jedna liczba mierząca, jak bardzo przewidywania modelu odbiegają od prawdy na danych treningowych. Trening polega na jej minimalizowaniu.
- Regresja wielomianowa InteraktywneRegresja wielomianowa dopasowuje krzywą, dodając potęgi cech do zwykłej regresji liniowej. Wysoki stopień szybko prowadzi do przeuczenia i dzikich wahań.
- Regresja grzbietowa i lasso InteraktywneRidge i lasso to regresja liniowa z karą za duże wagi. Ridge kurczy wszystkie współczynniki, lasso część z nich zeruje i w ten sposób wybiera cechy.
- Regularyzacja L1 czy L2L1 (Lasso) zeruje część wag i sama wybiera cechy, L2 (Ridge) zmniejsza wszystkie wagi, nie zerując żadnej. L1 służy przy wielu zbędnych cechach.
- Regresja logistyczna InteraktywneRegresja logistyczna to model klasyfikacji, który ważoną sumę cech zamienia funkcją sigmoidalną w prawdopodobieństwo. Wagi czyta się jako ilorazy szans.
- Granica decyzyjna InteraktywneGranica decyzyjna to miejsce w przestrzeni cech, gdzie klasyfikator zmienia zdanie. Jej kształt zdradza założenia modelu i jego skłonność do przeuczenia.
- Metoda k najbliższych sąsiadów (kNN) InteraktywneMetoda kNN klasyfikuje nowy punkt głosem k najbliższych przykładów treningowych. Jest prosta i elastyczna, ale wrażliwa na skalę cech i ich liczbę.
- Naiwny klasyfikator Bayesa InteraktywneNaiwny Bayes liczy prawdopodobieństwo klasy z twierdzenia Bayesa, zakładając niezależność cech. Klasyfikuje nieźle, ale jego pewność bywa mocno zawyżona.
- Drzewo decyzyjne InteraktywneDrzewo decyzyjne klasyfikuje przykład serią pytań tak/nie o pojedyncze cechy („wiek ≤ 6,5?”) aż do liścia z decyzją. Dzieli przestrzeń cech na prostokąty.
- Zysk informacyjny i gain podziału InteraktywneGain to ocena pytania w drzewie: o ile grupy po podziale są bardziej jednorodne niż przed nim. XGBoost liczy go z gradientów i hesjanów straty, z karami λ i γ.
- Przycinanie drzew decyzyjnych InteraktywnePrzycinanie usuwa z drzewa decyzyjnego gałęzie, które dopasowują szum zamiast reguły. Drzewo jest mniejsze, czytelniejsze i zwykle lepiej uogólnia.
- Regresja logistyczna czy drzewo decyzyjneRegresja logistyczna wygrywa, gdy wpływ cech jest w miarę liniowy i potrzebne są wiarygodne prawdopodobieństwa. Drzewo wygrywa przy progach i interakcjach.
- Bagging (agregacja bootstrapowa) InteraktywneBagging uczy wiele kopii modelu na losowych próbkach bootstrapowych i uśrednia ich przewidywania. Zmniejsza wariancję niestabilnych modeli, nie obciążenie.
- Las losowy InteraktywneLas losowy uśrednia setki drzew decyzyjnych uczonych na losowych próbkach danych i losowych podzbiorach cech. Dzięki temu jest dokładny i stabilny.
- AdaBoostAdaBoost uczy proste klasyfikatory po kolei, za każdym razem zwiększając wagę przykładów, na których poprzednie się myliły, i łączy je w ważone głosowanie.
- Wzmacnianie gradientowe InteraktywneWzmacnianie gradientowe buduje model krok po kroku: każde nowe płytkie drzewo poprawia błędy dotychczasowej sumy drzew, idąc w kierunku spadku straty.
- Bagging czy boostingBagging uśrednia niezależne, złożone modele i zmniejsza wariancję. Boosting składa po kolei proste modele i zmniejsza obciążenie, ale łatwiej uczy się szumu.
- Las losowy czy gradient boostingGradient boosting po dostrojeniu bywa o włos dokładniejszy, las losowy jest odporniejszy na złe ustawienia. Na małych danych różnice giną zwykle w szumie.
- XGBoost, LightGBM i CatBoost InteraktywneXGBoost, LightGBM i CatBoost to szybkie biblioteki wzmacniania gradientowego. Różnią się sposobem budowy drzew, obsługą kategorii i domyślnymi ustawieniami.
- XGBoost, LightGBM czy CatBoostPo dostrojeniu XGBoost, LightGBM i CatBoost dają niemal identyczne wyniki. Różnią się ustawieniami domyślnymi, obsługą kategorii, szybkością i ekosystemem.
- Maszyna wektorów nośnych (SVM) InteraktywneSVM szuka granicy, która oddziela klasy z jak największym marginesem. Decydują o niej tylko punkty przy granicy, a jądra pozwalają kreślić granice krzywe.
- Sztuczka jądrowaSztuczka jądrowa pozwala modelowi liniowemu działać w ogromnej przestrzeni cech bez jej liczenia: wystarczy funkcja, która zwraca iloczyny skalarne.