Dane referencyjne · 891 wierszy · 7 cech
Titanic
891 pasażerów Titanica z danymi o klasie, płci, wieku, rodzinie na pokładzie i cenie biletu, oraz informacją, kto przeżył katastrofę 15 kwietnia 1912 roku. Najpopularniejszy zbiór startowy w uczeniu maszynowym.
Dlaczego ten zbiór
Ma wszystko, co spotkasz w prawdziwych danych: brakujące wartości (wiek nieznany u 177 osób), cechy kategoryczne i liczbowe, silne interakcje (płeć × klasa) i niezbalansowaną klasę docelową (przeżyło 38%).
Podgląd
| survived | pclass | sex | age | sibsp | parch | fare | embarked |
|---|---|---|---|---|---|---|---|
| 0 | 3 | male | 22 | 1 | 0 | 7,25 | S |
| 1 | 1 | female | 38 | 1 | 0 | 71,28 | C |
| 1 | 3 | female | 26 | 0 | 0 | 7,93 | S |
| 1 | 1 | female | 35 | 1 | 0 | 53,1 | S |
| 0 | 3 | male | 35 | 0 | 0 | 8,05 | S |
| 0 | 3 | male | brak | 0 | 0 | 8,46 | Q |
| 0 | 1 | male | 54 | 0 | 0 | 51,86 | S |
| 0 | 3 | male | 2 | 3 | 1 | 21,07 | S |
Kolumny
| Kolumna | Znaczenie | Typ | Braki | Zakres / najczęstsze |
|---|---|---|---|---|
survived | czy przeżył (1) czy nie (0) — cel | kategorie (liczby) | 0 | 0, 1 |
pclass | klasa biletu: 1, 2 lub 3 | kategorie (liczby) | 0 | 1, 2, 3 |
sex | płeć | kategoria | 0 | male (577), female (314) |
age | wiek w latach | liczba | 177 | 0,42 – 80 (średnia 29,7) |
sibsp | liczba rodzeństwa i małżonków na pokładzie | kategorie (liczby) | 0 | 0, 1, 2, 3, 4, 5, 8 |
parch | liczba rodziców i dzieci na pokładzie | kategorie (liczby) | 0 | 0, 1, 2, 3, 4, 5, 6 |
fare | cena biletu (funty) | liczba | 0 | 0 – 512,3 (średnia 32,2) |
embarked | port zaokrętowania: S = Southampton, C = Cherbourg, Q = Queenstown | kategoria | 2 | S (644), C (168), Q (77) |
Źródło i licencja
Encyclopedia Titanica via Kaggle "Titanic: Machine Learning from Disaster"; CSV from seaborn-data (Waskom). Licencja: public domain (historical records). Strona zbioru.
Hasła, w których pojawia się ten zbiór
Podstawy prawdopodobieństwa InteraktywnePrawdopodobieństwo to liczba od 0 do 1 mierząca, jak bardzo możliwe jest zdarzenie. Trzy proste aksjomaty dają reguły dopełnienia, sumy i niezależności.Prawdopodobieństwo warunkowe InteraktywnePrawdopodobieństwo warunkowe P(A|B) to szansa zdarzenia A, gdy wiemy, że zaszło B. To zawężenie świata do przypadków B — i nie wolno go odwracać bez Bayesa.Twierdzenie Bayesa InteraktywneTwierdzenie Bayesa odwraca warunek: z P(dowód|hipoteza) liczy P(hipoteza|dowód), łącząc siłę dowodu z tym, jak częsta była hipoteza przed jego poznaniem.Zmienne losowe i rozkładyZmienna losowa przypisuje liczbę wynikowi losowego zjawiska, a jej rozkład mówi, jak prawdopodobne są poszczególne wartości. To most między danymi a modelem.Wartość oczekiwana i wariancjaWartość oczekiwana to średnia, wokół której skupia się zmienna losowa, a wariancja mierzy, jak szeroko wartości rozrzucają się wokół tej średniej.Próbkowanie i błąd standardowy InteraktywneBłąd standardowy mówi, jak bardzo wynik z próby zmieniałby się przy ponownym losowaniu. Maleje jak 1/√n: czterokrotnie większa próba to połowa błędu.Bootstrap InteraktywneBootstrap szacuje niepewność dowolnej statystyki, losując ze zwracaniem wiele nowych prób z danych i patrząc, jak bardzo zmienia się jej wartość.Testowanie hipotez i wartość p InteraktywneTest hipotez sprawdza, czy dane byłyby zaskakujące, gdyby efektu nie było. Wartość p mierzy to zaskoczenie, ale nie mówi, czy efekt jest prawdziwy ani duży.Metoda największej wiarygodności InteraktywneMetoda największej wiarygodności wybiera parametry, przy których zaobserwowane dane są najbardziej prawdopodobne. Z niej biorą się MSE i entropia krzyżowa.Wnioskowanie bayesowskieWnioskowanie bayesowskie traktuje parametry jak niepewne wielkości: łączy wiedzę a priori z danymi i daje pełny rozkład a posteriori zamiast jednej liczby.Entropia i dywergencja KLEntropia mierzy średnią niepewność rozkładu w bitach. Dywergencja KL mówi, ile bitów tracimy, opisując dane rozkładem Q zamiast prawdziwego rozkładu P.Typy danych w uczeniu maszynowymTyp danych mówi, jakie operacje na zmiennej mają sens: liczbowe, porządkowe, nominalne, tekst, obrazy i czas wymagają innego przygotowania dla modelu.Statystyki opisowe InteraktywneStatystyki opisowe streszczają rozkład kilkoma liczbami: położenie, rozrzut i kształt. Średnia i odchylenie są wrażliwe na skośność, mediana i IQR odporne.Brakujące wartości i imputacja InteraktywneBrak danych rzadko jest przypadkowy. Mechanizm braków (MCAR, MAR, MNAR) decyduje, czy usunąć wiersze, imputować wartości, czy uczynić z braku osobną cechę.Wykrywanie wartości odstającychWartość odstająca to obserwacja daleka od reszty: błąd albo rzadki, prawdziwy przypadek. Reguły IQR, z-score i Isolation Forest mówią tylko, co nietypowe.Kodowanie zmiennych kategorycznychModel liczy na liczbach, więc kategorie trzeba zakodować. One-hot nie wprowadza fałszywego porządku, kodowanie liczbami tak, a target encoding grozi wyciekiem.Inżynieria cechInżynieria cech to tworzenie nowych zmiennych z wiedzy o problemie: proporcji, progów, interakcji. Daje prostemu modelowi kształty, których sam nie zbuduje.Błąd doboru próbyBłąd doboru próby powstaje, gdy dane nie reprezentują populacji, na której model ma działać. Więcej takich danych nie pomoże — model uczy się złego świata.Regresja logistyczna InteraktywneRegresja logistyczna to model klasyfikacji, który ważoną sumę cech zamienia funkcją sigmoidalną w prawdopodobieństwo. Wagi czyta się jako ilorazy szans.Drzewo decyzyjne InteraktywneDrzewo decyzyjne klasyfikuje przykład serią pytań tak/nie o pojedyncze cechy („wiek ≤ 6,5?”) aż do liścia z decyzją. Dzieli przestrzeń cech na prostokąty.Zysk informacyjny i gain podziału InteraktywneGain to ocena pytania w drzewie: o ile grupy po podziale są bardziej jednorodne niż przed nim. XGBoost liczy go z gradientów i hesjanów straty, z karami λ i γ.Przycinanie drzew decyzyjnych InteraktywnePrzycinanie usuwa z drzewa decyzyjnego gałęzie, które dopasowują szum zamiast reguły. Drzewo jest mniejsze, czytelniejsze i zwykle lepiej uogólnia.Regresja logistyczna czy drzewo decyzyjneRegresja logistyczna wygrywa, gdy wpływ cech jest w miarę liniowy i potrzebne są wiarygodne prawdopodobieństwa. Drzewo wygrywa przy progach i interakcjach.Bagging czy boostingBagging uśrednia niezależne, złożone modele i zmniejsza wariancję. Boosting składa po kolei proste modele i zmniejsza obciążenie, ale łatwiej uczy się szumu.Las losowy czy gradient boostingGradient boosting po dostrojeniu bywa o włos dokładniejszy, las losowy jest odporniejszy na złe ustawienia. Na małych danych różnice giną zwykle w szumie.XGBoost, LightGBM i CatBoost InteraktywneXGBoost, LightGBM i CatBoost to szybkie biblioteki wzmacniania gradientowego. Różnią się sposobem budowy drzew, obsługą kategorii i domyślnymi ustawieniami.XGBoost, LightGBM czy CatBoostPo dostrojeniu XGBoost, LightGBM i CatBoost dają niemal identyczne wyniki. Różnią się ustawieniami domyślnymi, obsługą kategorii, szybkością i ekosystemem.Złudzenie trafności treningowejWysoki wynik na zbiorze treningowym może być zapamiętaniem przykładów, a nie reguły. Prawdę o modelu mówi tylko wynik na danych, których model nie widział.Modele bazoweModel bazowy to najprostsze sensowne rozwiązanie, np. zawsze najczęstsza klasa. Bez niego nie wiadomo, czy wynik modelu jest dobry, czy tylko tak wygląda.Trafność czy zbalansowana trafnośćTrafność liczy odsetek wszystkich poprawnych odpowiedzi, a zbalansowana trafność uśrednia recall każdej klasy. Przy rzadkiej klasie tylko ta druga widzi kłopot.ROC AUC czy PR AUCROC AUC nie zależy od częstości klasy pozytywnej i ocenia cały ranking. PR AUC spada razem z częstością i pokazuje, ile warte są alarmy przy rzadkiej klasie.Jak wybrać metrykę oceny modeluMetrykę dobiera się do decyzji: etykieta, ranking czy prawdopodobieństwo, koszty błędów i proporcje klas. Inna metryka to często inny zwycięski model.Wpływ cechy InteraktywneWpływ cechy mówi, o ile zmienia się odpowiedź modelu po zmianie jednej cechy. W modelu liniowym to waga po standaryzacji, w innych — permutacja lub SHAP.Ważność permutacyjna cech InteraktywneWażność permutacyjna mierzy, o ile pogarsza się wynik modelu, gdy losowo przetasujemy wartości jednej cechy. Działa dla każdego modelu i na danych testowych.Zależność częściowa i krzywe ICEWykres zależności częściowej pokazuje, jak średnio zmienia się przewidywanie modelu wraz z jedną cechą. Krzywe ICE pokazują to osobno dla każdego przykładu.Wartości SHAP InteraktywneWartości SHAP rozkładają przewidywanie modelu dla jednego przykładu na wkłady cech, które sumują się do różnicy między tym przewidywaniem a średnią.Przebieg projektu uczenia maszynowegoProjekt ML to pętla: określ problem i metrykę, zbuduj punkt odniesienia, waliduj uczciwie, poprawiaj małymi krokami, a potem wdrażaj i monitoruj.Formułowanie problemu MLFormułowanie problemu to decyzja, co dokładnie przewidujemy, na jakich danych dostępnych w chwili predykcji i jaką metryką mierzymy sukces modelu.Jak wybrać model uczenia maszynowegoNie ma modelu najlepszego zawsze. Zacznij od punktu odniesienia i modelu liniowego, dodaj las lub boosting, a wybór rozstrzygnij walidacją krzyżową.Ile danych potrzeba do uczenia modeluNie ma uniwersalnej liczby. Odpowiada krzywa uczenia: gdy wynik wciąż rośnie z liczbą przykładów, więcej danych pomoże; gdy stoi, zmień model lub cechy.Pipeline w scikit-learn InteraktywnePipeline łączy przetwarzanie danych i model w jeden obiekt, dzięki czemu każdy krok uczy się tylko na danych uczących, a walidacja nie przepuszcza wycieku.Powtarzalność eksperymentów MLPowtarzalność to możliwość odtworzenia wyniku: te same dane, kod, wersje bibliotek i ziarna losowości, a także raport rozrzutu wyniku między ziarnami.Debugowanie modeli MLDebugowanie modelu to seria testów kontrolnych: baseline, przeuczenie małej próbki, przetasowane etykiety, krzywe uczenia i analiza błędów.Przeuczenie modelu — lista kontrolnaLista kontrolna przeuczenia: luka trening–walidacja, przeciek w przetwarzaniu, duplikaty i grupy, zbyt wiele prób na walidacji i test na losowych etykietach.Jak pracować w konkursach KagglePraca na Kaggle to pętla: zrozum metrykę, zbuduj walidację podobną do testu, wyślij prosty baseline, ulepszaj według lokalnej CV, nie rankingu publicznego.Lokalna CV a ranking publiczny InteraktywneRanking publiczny liczy się na małej części testu i jest zaszumiony, a lokalna CV korzysta z większej próby. Ostateczny model wybieraj według CV, nie rankingu.Zespoły modeli i stacking InteraktywneZespół modeli uśrednia lub łączy predykcje kilku modeli. Działa, gdy modele mylą się w różnych miejscach, a stacking uczy się wag na predykcjach out-of-fold.Wdrożenie modelu MLWdrożenie to przeniesienie modelu z notebooka do systemu, który podejmuje decyzje: zapis z przetwarzaniem, API lub wsad, walidacja wejścia, wersje i monitoring.Monitoring i dryf danychDryf to zmiana rozkładu danych lub zależności cech od celu po wdrożeniu. Monitoring śledzi wejścia, predykcje i metryki, zanim jakość po cichu spadnie.Twierdzenie „nie ma darmowego lunchu”Uśredniony po wszystkich możliwych problemach żaden algorytm uczenia nie jest lepszy od innego. Przewaga zawsze bierze się z założeń dopasowanych do danych.Prawo wielkich liczb InteraktywneŚrednia z coraz większej liczby niezależnych prób zbliża się do wartości oczekiwanej. Wyjaśniamy, dlaczego tak jest i czego to prawo nie obiecuje.Centralne twierdzenie graniczne InteraktywneSuma lub średnia wielu niezależnych wartości ma w przybliżeniu rozkład normalny, nawet gdy pojedyncze wartości są skrajnie skośne. Skąd to się bierze.Błąd zaniedbania stopy bazowej InteraktywneTrafny test przy rzadkim zjawisku daje głównie fałszywe alarmy, bo zdrowych jest dużo więcej niż chorych. Dlaczego ludzie i modele o tym zapominają.Błąd przeżywalnościWnioski wyciągane tylko z tych, którzy przetrwali selekcję, są zniekształcone, bo nie widać tych, którzy odpadli. Samoloty Walda i pasażerowie Titanica.Błąd ekologicznyZależność między średnimi grup nie musi zachodzić dla pojedynczych osób w tych grupach, a nawet może mieć odwrotny znak. Dlaczego tak się dzieje.Korelacja to nie przyczynowośćDwie zmienne mogą iść w parze, bo łączy je wspólna przyczyna, odwrotny kierunek wpływu, selekcja albo przypadek. Jak to rozpoznać i co z tym zrobić.Prawo BenfordaW wielu zbiorach liczb pierwszą cyfrą jest 1 w około 30% przypadków, a 9 tylko w 5%. Kiedy prawo Benforda działa, dlaczego i kiedy zawodzi.Zasada Pareto (80/20)W wielu zjawiskach niewielka część przyczyn odpowiada za większość skutków. Skąd bierze się ta nierówność i kiedy 80/20 jest prawdą, a kiedy sloganem.Efekt RashomonWiele różnych modeli osiąga prawie identyczną dokładność, a mimo to opowiada odmienne historie o tym, które cechy są ważne i jak działa świat.