ML Atlas

Dane referencyjne · 442 wierszy · 10 cech

Diabetes (progresja cukrzycy)

442 pacjentów z cukrzycą: wiek, płeć, BMI, ciśnienie krwi i sześć pomiarów z krwi, a jako cel — miara postępu choroby rok później. Zbiór z pracy Efrona i in. o regresji LARS.

Dlaczego ten zbiór

Klasyczny zbiór do regresji: pokazuje regresję liniową, regularyzację (Ridge, Lasso) i to, jak mało wyjaśnia pojedyncza cecha.

Podgląd

agesexbmibps1s2s3s4s5s6target
59232,110115793,23844,8687151
48121,687183103,27033,896975
72230,59315693,64144,6785141
24125,384198131,44054,8989206
50123101192125,45244,2980135
23122,68913964,86124,196897
362229016099,65033,9582138
66226,2114255185564,554,259263

Kolumny

KolumnaZnaczenieTypBrakiZakres / najczęstsze
agewiekliczba019 – 79 (średnia 48,52)
sexpłećkategorie (liczby)01, 2
bmiwskaźnik masy ciałaliczba018 – 42,2 (średnia 26,38)
bpśrednie ciśnienie krwiliczba062 – 133 (średnia 94,65)
s1cholesterol całkowityliczba097 – 301 (średnia 189,14)
s2LDLliczba041,6 – 242,4 (średnia 115,44)
s3HDLliczba022 – 99 (średnia 49,79)
s4stosunek cholesterolu do HDLliczba02 – 9,09 (średnia 4,07)
s5log trójglicerydówliczba03,26 – 6,11 (średnia 4,64)
s6glukozaliczba058 – 124 (średnia 91,26)
targetpostęp choroby po rokuliczba025 – 346 (średnia 152,13)

Źródło i licencja

Efron, B., Hastie, T., Johnstone, I., Tibshirani, R. (2004). Least angle regression. Annals of Statistics 32(2). Licencja: free for research and teaching (distributed with scikit-learn). Strona zbioru.

Hasła, w których pojawia się ten zbiór

Pochodna InteraktywnePochodna mówi, jak szybko zmienia się wynik funkcji przy małej zmianie wejścia. W ML wskazuje, w którą stronę i jak mocno poprawić parametr modelu.Cechy wielomianowe i interakcje InteraktywneCechy wielomianowe to potęgi i iloczyny zmiennych. Pozwalają modelowi liniowemu wyrażać krzywe i interakcje, ale ich liczba rośnie lawinowo.Regresja liniowa InteraktywneRegresja liniowa przewiduje liczbę jako ważoną sumę cech plus stałą. Wagi dobiera metodą najmniejszych kwadratów, a każda mówi o wpływie cechy.Metoda najmniejszych kwadratów InteraktywneMetoda najmniejszych kwadratów dobiera parametry modelu tak, by suma kwadratów błędów była minimalna. Ma wzór zamknięty, ale jest wrażliwa na odstające punkty.Regresja wielomianowa InteraktywneRegresja wielomianowa dopasowuje krzywą, dodając potęgi cech do zwykłej regresji liniowej. Wysoki stopień szybko prowadzi do przeuczenia i dzikich wahań.Regresja grzbietowa i lasso InteraktywneRidge i lasso to regresja liniowa z karą za duże wagi. Ridge kurczy wszystkie współczynniki, lasso część z nich zeruje i w ten sposób wybiera cechy.Regularyzacja L1 czy L2L1 (Lasso) zeruje część wag i sama wybiera cechy, L2 (Ridge) zmniejsza wszystkie wagi, nie zerując żadnej. L1 służy przy wielu zbędnych cechach.Wzmacnianie gradientowe InteraktywneWzmacnianie gradientowe buduje model krok po kroku: każde nowe płytkie drzewo poprawia błędy dotychczasowej sumy drzew, idąc w kierunku spadku straty.Bagging czy boostingBagging uśrednia niezależne, złożone modele i zmniejsza wariancję. Boosting składa po kolei proste modele i zmniejsza obciążenie, ale łatwiej uczy się szumu.Las losowy czy gradient boostingGradient boosting po dostrojeniu bywa o włos dokładniejszy, las losowy jest odporniejszy na złe ustawienia. Na małych danych różnice giną zwykle w szumie.XGBoost, LightGBM czy CatBoostPo dostrojeniu XGBoost, LightGBM i CatBoost dają niemal identyczne wyniki. Różnią się ustawieniami domyślnymi, obsługą kategorii, szybkością i ekosystemem.Metryki regresji: MAE, RMSE, R² InteraktywneMAE mierzy przeciętny błąd, RMSE mocniej karze duże pomyłki, a R² mówi, jaką część zmienności celu model wyjaśnia w porównaniu z przewidywaniem średniej.Jak wybrać metrykę oceny modeluMetrykę dobiera się do decyzji: etykieta, ranking czy prawdopodobieństwo, koszty błędów i proporcje klas. Inna metryka to często inny zwycięski model.Learning rate (współczynnik uczenia) InteraktywneLearning rate to współczynnik skalujący krok wzdłuż ujemnego gradientu przy aktualizacji wag. Za mały spowalnia trening, za duży daje oscylacje i rozbieżność.Regularyzacja (L2, dropout, early stopping) InteraktywneRegularyzacja ogranicza dopasowanie modelu do szumu: kara za duże wagi (L2), losowe wyłączanie neuronów (dropout) i wcześniejszy koniec treningu.Brzytwa Ockhama w uczeniu maszynowymSpośród modeli równie dobrze wyjaśniających dane wybieraj prostszy. W ML to rozsądna heurystyka chroniąca przed przeuczeniem, ale nie twarde prawo.