ML Atlas

Dane referencyjne · 344 wierszy · 6 cech

Palmer Penguins (pingwiny z Antarktydy)

344 pingwiny trzech gatunków (Adelie, Chinstrap, Gentoo) z trzech wysp archipelagu Palmera: długość i grubość dzioba, długość płetwy, masa ciała i płeć.

Dlaczego ten zbiór

Nowoczesny następca Iris: realne braki danych, cechy w bardzo różnych skalach (gramy kontra milimetry) — świetny do pokazania standaryzacji, klastrowania i klasyfikacji.

Podgląd

speciesislandbill_length_mmbill_depth_mmflipper_length_mmbody_mass_gsex
AdelieTorgersen39,118,71813750MALE
AdelieTorgersen39,517,41863800FEMALE
AdelieTorgersen40,3181953250FEMALE
AdelieTorgersenbrakbrakbrakbrakbrak
AdelieTorgersen36,719,31933450FEMALE
AdelieTorgersen39,320,61903650MALE
AdelieTorgersen38,917,81813625FEMALE
AdelieTorgersen39,219,61954675MALE

Kolumny

KolumnaZnaczenieTypBrakiZakres / najczęstsze
speciesgatunek — celkategoria0Adelie (152), Gentoo (124), Chinstrap (68)
islandwyspakategoria0Biscoe (168), Dream (124), Torgersen (52)
bill_length_mmdługość dzioba (mm)liczba232,1 – 59,6 (średnia 43,92)
bill_depth_mmgrubość dzioba (mm)liczba213,1 – 21,5 (średnia 17,15)
flipper_length_mmdługość płetwy (mm)liczba2172 – 231 (średnia 200,92)
body_mass_gmasa ciała (g)liczba22700 – 6300 (średnia 4201,75)
sexpłećkategoria11MALE (168), FEMALE (165)

Źródło i licencja

Gorman, K., Williams, T., Fraser, W. (2014). PLoS ONE 9(3); Horst, A., Hill, A., Gorman, K. (2020). palmerpenguins R package. Licencja: CC0 1.0. Strona zbioru.

Hasła, w których pojawia się ten zbiór

Zmienne losowe i rozkładyZmienna losowa przypisuje liczbę wynikowi losowego zjawiska, a jej rozkład mówi, jak prawdopodobne są poszczególne wartości. To most między danymi a modelem.Rozkład normalnyRozkład normalny to symetryczna krzywa dzwonowa opisana średnią i odchyleniem standardowym. Pojawia się tam, gdzie wynik jest sumą wielu drobnych wpływów.Wartość oczekiwana i wariancjaWartość oczekiwana to średnia, wokół której skupia się zmienna losowa, a wariancja mierzy, jak szeroko wartości rozrzucają się wokół tej średniej.Kowariancja i korelacja InteraktywneKowariancja mówi, czy dwie zmienne rosną razem, ale zależy od jednostek. Korelacja to kowariancja przeskalowana do zakresu od −1 do 1.Przedział ufności InteraktywnePrzedział ufności to zakres wyliczony z próby metodą, która w 95% powtórzeń obejmuje prawdziwy parametr. Pokazuje, jak dokładny jest wynik.Testowanie hipotez i wartość p InteraktywneTest hipotez sprawdza, czy dane byłyby zaskakujące, gdyby efektu nie było. Wartość p mierzy to zaskoczenie, ale nie mówi, czy efekt jest prawdziwy ani duży.Metoda największej wiarygodności InteraktywneMetoda największej wiarygodności wybiera parametry, przy których zaobserwowane dane są najbardziej prawdopodobne. Z niej biorą się MSE i entropia krzyżowa.Entropia i dywergencja KLEntropia mierzy średnią niepewność rozkładu w bitach. Dywergencja KL mówi, ile bitów tracimy, opisując dane rozkładem Q zamiast prawdziwego rozkładu P.Eksploracyjna analiza danych (EDA) InteraktywneEDA to oglądanie danych przed modelowaniem: rozkłady, braki, zależności i podgrupy. Wykrywa błędy i pułapki, których nie pokaże żadna metryka modelu.Statystyki opisowe InteraktywneStatystyki opisowe streszczają rozkład kilkoma liczbami: położenie, rozrzut i kształt. Średnia i odchylenie są wrażliwe na skośność, mediana i IQR odporne.Normalizacja czy standaryzacjaNormalizacja min-max ściska cechę do przedziału 0–1, standaryzacja daje średnią 0 i odchylenie 1. Ważniejsze od wyboru metody jest to, by w ogóle skalować.Uczenie nadzorowane a nienadzorowaneW uczeniu nadzorowanym model dostaje przykłady z poprawnymi odpowiedziami, w nienadzorowanym tylko surowe dane i sam szuka w nich struktury.Granica decyzyjna InteraktywneGranica decyzyjna to miejsce w przestrzeni cech, gdzie klasyfikator zmienia zdanie. Jej kształt zdradza założenia modelu i jego skłonność do przeuczenia.Metoda k najbliższych sąsiadów (kNN) InteraktywneMetoda kNN klasyfikuje nowy punkt głosem k najbliższych przykładów treningowych. Jest prosta i elastyczna, ale wrażliwa na skalę cech i ich liczbę.Regresja logistyczna czy drzewo decyzyjneRegresja logistyczna wygrywa, gdy wpływ cech jest w miarę liniowy i potrzebne są wiarygodne prawdopodobieństwa. Drzewo wygrywa przy progach i interakcjach.Trafność czy zbalansowana trafnośćTrafność liczy odsetek wszystkich poprawnych odpowiedzi, a zbalansowana trafność uśrednia recall każdej klasy. Przy rzadkiej klasie tylko ta druga widzi kłopot.Uczenie nienadzorowane InteraktywneUczenie bez etykiet: algorytm sam szuka w danych grup, ukrytych kierunków i nietypowych punktów. Wynik zależy od kryterium i od tego, jak opiszesz dane.K-means InteraktywneK-means dzieli punkty na k grup: każdy punkt trafia do najbliższego środka, a środki przesuwają się do średniej swojej grupy. Zwraca k grup, nawet gdy ich brak.Pułapki metody k-średnich InteraktywneK-średnich zawsze zwróci k grup, nawet bez sensu. Psują go skale cech, złe ziarno startowe, wydłużone i nierówne skupiska oraz źle dobrane k.Współczynnik silhouette InteraktywneSilhouette porównuje, jak blisko punkt jest własnego klastra, a jak blisko najbliższego obcego. Ocenia konkretny podział, nie dane — dlatego zmienia się z k.Klasteryzacja hierarchicznaKlasteryzacja hierarchiczna łączy punkty krok po kroku w coraz większe grupy i rysuje z tego drzewo – dendrogram. Liczbę grup wybierasz dopiero na końcu.DBSCAN — klasteryzacja gęstościowaDBSCAN łączy w grupy obszary gęsto upakowanych punktów, a rzadkie punkty oznacza jako szum. Znajduje skupiska dowolnego kształtu bez podawania ich liczby.K-średnich czy DBSCANK-średnich dzieli dane na k zwartych, kulistych grup i przypisuje każdy punkt. DBSCAN szuka gęstych obszarów dowolnego kształtu i odrzuca punkty-szum.Mieszanina gaussowska i algorytm EMMieszanina gaussowska zakłada, że dane pochodzą z kilku rozkładów normalnych. Algorytm EM na zmianę zgaduje przynależność punktów i poprawia rozkłady.Wszystkie modele są błędneKażdy model jest uproszczeniem i w jakimś sensie fałszywy. Pytanie nie brzmi „czy jest prawdziwy”, tylko „czy jest wystarczająco dobry do tego celu”.Błąd ekologicznyZależność między średnimi grup nie musi zachodzić dla pojedynczych osób w tych grupach, a nawet może mieć odwrotny znak. Dlaczego tak się dzieje.Prawo BenfordaW wielu zbiorach liczb pierwszą cyfrą jest 1 w około 30% przypadków, a 9 tylko w 5%. Kiedy prawo Benforda działa, dlaczego i kiedy zawodzi.Zasada Pareto (80/20)W wielu zjawiskach niewielka część przyczyn odpowiada za większość skutków. Skąd bierze się ta nierówność i kiedy 80/20 jest prawdą, a kiedy sloganem.