Dane referencyjne · 569 wierszy · 10 cech
Breast Cancer Wisconsin (diagnostyka raka piersi)
569 biopsji cienkoigłowych z cechami jąder komórkowych zmierzonymi na zdjęciach mikroskopowych (promień, tekstura, obwód, wklęsłość…) i diagnozą: złośliwy czy łagodny.
Dlaczego ten zbiór
Klasyczny problem binarny o wysokiej stawce: pomyłka w jedną stronę kosztuje inaczej niż w drugą. Idealny do progu decyzji, krzywej ROC, precision/recall i kalibracji.
Podgląd
| mean radius | mean texture | mean perimeter | mean area | mean smoothness | mean compactness | mean concavity | mean concave points | mean symmetry | mean fractal dimension | target |
|---|---|---|---|---|---|---|---|---|---|---|
| 17,99 | 10,38 | 122,8 | 1001 | 0,12 | 0,28 | 0,3 | 0,15 | 0,24 | 0,08 | 0 |
| 20,57 | 17,77 | 132,9 | 1326 | 0,08 | 0,08 | 0,09 | 0,07 | 0,18 | 0,06 | 0 |
| 19,69 | 21,25 | 130 | 1203 | 0,11 | 0,16 | 0,2 | 0,13 | 0,21 | 0,06 | 0 |
| 11,42 | 20,38 | 77,58 | 386,1 | 0,14 | 0,28 | 0,24 | 0,11 | 0,26 | 0,1 | 0 |
| 20,29 | 14,34 | 135,1 | 1297 | 0,1 | 0,13 | 0,2 | 0,1 | 0,18 | 0,06 | 0 |
| 12,45 | 15,7 | 82,57 | 477,1 | 0,13 | 0,17 | 0,16 | 0,08 | 0,21 | 0,08 | 0 |
| 18,25 | 19,98 | 119,6 | 1040 | 0,09 | 0,11 | 0,11 | 0,07 | 0,18 | 0,06 | 0 |
| 13,71 | 20,83 | 90,2 | 577,9 | 0,12 | 0,16 | 0,09 | 0,06 | 0,22 | 0,07 | 0 |
Kolumny
| Kolumna | Znaczenie | Typ | Braki | Zakres / najczęstsze |
|---|---|---|---|---|
mean radius | średni promień jądra | liczba | 0 | 6,98 – 28,11 (średnia 14,13) |
mean texture | tekstura (odchylenie odcieni szarości) | liczba | 0 | 9,71 – 39,28 (średnia 19,29) |
mean perimeter | obwód | liczba | 0 | 43,79 – 188,5 (średnia 91,97) |
mean area | pole | liczba | 0 | 143,5 – 2501 (średnia 654,89) |
mean smoothness | gładkość brzegu | liczba | 0 | 0,05 – 0,16 (średnia 0,1) |
mean compactness | zwartość | liczba | 0 | 0,02 – 0,35 (średnia 0,1) |
mean concavity | wklęsłość | liczba | 0 | 0 – 0,43 (średnia 0,09) |
mean concave points | liczba wklęsłych punktów | liczba | 0 | 0 – 0,2 (średnia 0,05) |
mean symmetry | symetria | liczba | 0 | 0,11 – 0,3 (średnia 0,18) |
mean fractal dimension | wymiar fraktalny brzegu | liczba | 0 | 0,05 – 0,1 (średnia 0,06) |
target | 0 = złośliwy, 1 = łagodny | kategorie (liczby) | 0 | 0, 1 |
Źródło i licencja
Wolberg, W., Mangasarian, O., Street, N., Street, W. (1995). UCI Machine Learning Repository. Licencja: CC BY 4.0. Strona zbioru.
Hasła, w których pojawia się ten zbiór
Reguła łańcuchowa InteraktywneReguła łańcuchowa mówi, że pochodna funkcji złożonej to iloczyn pochodnych jej ogniw. Dzięki niej sieć wie, jak każda waga wpływa na błąd na końcu.Gradient i spadek gradientu InteraktywneGradient to wektor pochodnych straty po wagach, wskazujący kierunek jej najszybszego wzrostu. Spadek gradientu przesuwa wagi małymi krokami w przeciwną stronę.Problem wielokrotnych porównań InteraktywneIm więcej testów robisz, tym pewniejsze są fałszywe odkrycia. Korekty Bonferroniego, Holma i Benjaminiego–Hochberga przywracają kontrolę nad błędami.Entropia krzyżowa (log loss) InteraktywneEntropia krzyżowa karze model ujemnym logarytmem prawdopodobieństwa danego poprawnej odpowiedzi. Nagradza uczciwe prawdopodobieństwa, nie same trafienia.Normalizacja czy standaryzacjaNormalizacja min-max ściska cechę do przedziału 0–1, standaryzacja daje średnią 0 i odchylenie 1. Ważniejsze od wyboru metody jest to, by w ogóle skalować.Selekcja cech InteraktywneSelekcja cech zostawia podzbiór zmiennych: by uprościć model, przyspieszyć go i zmniejszyć szum. Wykonana poza walidacją krzyżową daje fałszywie wysokie wyniki.Zbiór treningowyZbiór treningowy to przykłady z poprawnymi odpowiedziami, na których model dopasowuje wagi. Model zakłada, że nowe dane mają ten sam rozkład i proporcje klas.Podział na zbiór treningowy i testowyZbiór testowy to dane, których model nie widział, więc mierzy działanie na nowych przypadkach. Podział ma naśladować użycie: losowo, warstwowo lub w czasie.Niezrównoważone klasyGdy jedna klasa jest rzadka, trafność kłamie, a model domyślnie ją ignoruje. Pomagają właściwe metryki, wagi klas, zmiana progu decyzji i ostrożny resampling.Wagi klasWagi klas mnożą stratę przykładu przez współczynnik zależny od klasy, zwykle odwrotność jej częstości. Pomyłka na klasie rzadkiej kosztuje w treningu więcej.SMOTE i resampling klasSMOTE tworzy syntetyczne przykłady rzadkiej klasy między jej sąsiadami. Przesuwa granicę decyzji podobnie jak wagi klas, ale psuje kalibrację prawdopodobieństw.Szum w etykietachSzum w etykietach to błędnie oznaczone przykłady treningowe. Elastyczne modele je zapamiętują i tracą trafność; pomaga regularyzacja i szukanie złych etykiet.Korelacja pozorna (spurious correlation)Korelacja pozorna to cecha, która w danych treningowych przypadkiem idzie w parze z etykietą, choć nie ma z nią związku. Trening ją wykorzysta, nowe dane nie.Czym jest uczenie maszynoweUczenie maszynowe to budowanie programów, które regułę wyprowadzają z przykładów, zamiast dostać ją od programisty. Liczy się trafność na nowych danych.Funkcja straty (loss) InteraktywneFunkcja straty to jedna liczba mierząca, jak bardzo przewidywania modelu odbiegają od prawdy na danych treningowych. Trening polega na jej minimalizowaniu.Regularyzacja L1 czy L2L1 (Lasso) zeruje część wag i sama wybiera cechy, L2 (Ridge) zmniejsza wszystkie wagi, nie zerując żadnej. L1 służy przy wielu zbędnych cechach.Naiwny klasyfikator Bayesa InteraktywneNaiwny Bayes liczy prawdopodobieństwo klasy z twierdzenia Bayesa, zakładając niezależność cech. Klasyfikuje nieźle, ale jego pewność bywa mocno zawyżona.Regresja logistyczna czy drzewo decyzyjneRegresja logistyczna wygrywa, gdy wpływ cech jest w miarę liniowy i potrzebne są wiarygodne prawdopodobieństwa. Drzewo wygrywa przy progach i interakcjach.Bagging (agregacja bootstrapowa) InteraktywneBagging uczy wiele kopii modelu na losowych próbkach bootstrapowych i uśrednia ich przewidywania. Zmniejsza wariancję niestabilnych modeli, nie obciążenie.Las losowy InteraktywneLas losowy uśrednia setki drzew decyzyjnych uczonych na losowych próbkach danych i losowych podzbiorach cech. Dzięki temu jest dokładny i stabilny.AdaBoostAdaBoost uczy proste klasyfikatory po kolei, za każdym razem zwiększając wagę przykładów, na których poprzednie się myliły, i łączy je w ważone głosowanie.Bagging czy boostingBagging uśrednia niezależne, złożone modele i zmniejsza wariancję. Boosting składa po kolei proste modele i zmniejsza obciążenie, ale łatwiej uczy się szumu.Las losowy czy gradient boostingGradient boosting po dostrojeniu bywa o włos dokładniejszy, las losowy jest odporniejszy na złe ustawienia. Na małych danych różnice giną zwykle w szumie.XGBoost, LightGBM czy CatBoostPo dostrojeniu XGBoost, LightGBM i CatBoost dają niemal identyczne wyniki. Różnią się ustawieniami domyślnymi, obsługą kategorii, szybkością i ekosystemem.Zbiór walidacyjnyZbiór walidacyjny to odłożone dane, na których model się nie uczy, a które służą do wyboru ustawień. Przeuczenie widać jako lukę między nim a treningiem.Przeuczenie i niedouczenie InteraktywnePrzeuczony model zapamiętuje szum ze zbioru treningowego i gorzej działa na nowych danych, a niedouczony jest za prosty, by uchwycić nawet główny wzorzec.Złudzenie trafności treningowejWysoki wynik na zbiorze treningowym może być zapamiętaniem przykładów, a nie reguły. Prawdę o modelu mówi tylko wynik na danych, których model nie widział.Mały zbiór treningowy i 100% trafności InteraktywnePrzy kilku przykładach model dopasuje dowolne etykiety, więc idealny wynik treningowy nie mówi, czy poznał regułę. Wymiar VC klasyfikatora liniowego to d+1.Macierz pomyłek InteraktywneMacierz pomyłek zlicza, ile przykładów każdej prawdziwej klasy model przypisał do każdej klasy. Z niej wynikają trafność, precyzja, recall i inne metryki.Precyzja i recall InteraktywnePrecyzja mówi, jaka część alarmów modelu jest prawdziwa, a recall, jaką część prawdziwych przypadków model wykrył. Zwykle poprawa jednej psuje drugą.Recall (czułość) InteraktywneRecall (czułość) to odsetek prawdziwych przykładów danej klasy, które model rozpoznał. Fałszywe alarmy mierzy precyzja. Średnia recalli to balanced accuracy.Precyzja czy recall — co ważniejszeO wyborze między precyzją a recall decyduje koszt błędów: gdy droższe jest przeoczenie, liczy się recall, gdy fałszywy alarm — precyzja. Próg wynika z kosztów.Miara F1 InteraktywneF1 to średnia harmoniczna precyzji i recall. Jest wysoka tylko wtedy, gdy obie są wysokie, więc karze modele, które poświęcają jedną dla drugiej.Zbalansowana trafność (balanced accuracy)Balanced accuracy to średnia z recalli wszystkich klas. Przy niezbalansowanych klasach nie nagradza modelu, który zawsze wybiera klasę najczęstszą.Próg decyzji InteraktywnePróg decyzji to reguła zamiany prawdopodobieństw na klasę. Próg 0,5 jest optymalny tylko przy równych kosztach pomyłek i tych samych proporcjach klas.ROC AUC (pole pod krzywą ROC) InteraktywneROC AUC to prawdopodobieństwo, że losowy przykład pozytywny dostanie wyższy wynik niż losowy negatywny. Zależy od kolejności wyników, nie od progu.Krzywa precyzja–recallKrzywa precyzja–recall pokazuje precyzję modelu przy każdym poziomie recall, czyli dla wszystkich progów naraz. Przy rzadkiej klasie mówi więcej niż ROC.Kalibracja modeluModel jest skalibrowany, gdy deklarowana pewność zgadza się z częstością trafień. Temperature scaling dzieli logity przez T z walidacji, nie zmieniając decyzji.Wykrywanie anomaliiWykrywanie anomalii szuka obserwacji, które nie pasują do reszty danych, zwykle bez etykiet. Działa tylko wtedy, gdy anomalie są rzadkie i naprawdę odmienne.Perceptron (sztuczny neuron)Perceptron to najprostszy sztuczny neuron: liczy sumę ważoną wejść plus bias i zwraca 1, gdy przekracza ona zero. Dzieli przestrzeń cech hiperpłaszczyzną.Mini-batch i rozmiar batchaMini-batch to porcja przykładów, na której liczy się jeden gradient i robi jeden krok. Mały batch daje szumny, częsty krok; duży gładki, ale rzadszy i droższy.Losowy seed i szczęśliwa inicjalizacjaLosowe wagi startowe dają przypadkową granicę decyzji, która czasem trafia blisko prawdziwej. Wynik zależy od seeda: jeden przebieg to jedno losowanie.Algorytmy ewolucyjneAlgorytm ewolucyjny optymalizuje bez gradientu: ocenia populację, zostawia najlepszych (selekcja), łączy ich geny (krzyżowanie) i losowo je zmienia (mutacja).Jak wybrać model uczenia maszynowegoNie ma modelu najlepszego zawsze. Zacznij od punktu odniesienia i modelu liniowego, dodaj las lub boosting, a wybór rozstrzygnij walidacją krzyżową.Ile danych potrzeba do uczenia modeluNie ma uniwersalnej liczby. Odpowiada krzywa uczenia: gdy wynik wciąż rośnie z liczbą przykładów, więcej danych pomoże; gdy stoi, zmień model lub cechy.Przeuczenie modelu — lista kontrolnaLista kontrolna przeuczenia: luka trening–walidacja, przeciek w przetwarzaniu, duplikaty i grupy, zbyt wiele prób na walidacji i test na losowych etykietach.Twierdzenie „nie ma darmowego lunchu”Uśredniony po wszystkich możliwych problemach żaden algorytm uczenia nie jest lepszy od innego. Przewaga zawsze bierze się z założeń dopasowanych do danych.Brzytwa Ockhama w uczeniu maszynowymSpośród modeli równie dobrze wyjaśniających dane wybieraj prostszy. W ML to rozsądna heurystyka chroniąca przed przeuczeniem, ale nie twarde prawo.Śmieci na wejściu, śmieci na wyjściuModel nie będzie lepszy niż dane, z których się uczy: błędne etykiety, stronnicza próbka i zbędne cechy przechodzą wprost do predykcji. Dlaczego tak jest.Wyciek danych (data leakage) InteraktywneWyciek danych to sytuacja, w której model w treningu lub walidacji dostaje informację niedostępną w chwili prawdziwej prognozy. Daje zawyżone wyniki.Klątwa zwycięzcy InteraktywneWynik kandydata wybranego jako najlepszy na tych samych danych jest zawyżony, bo wybór faworyzuje korzystny szum pomiaru. Na nowych danych szczęście znika.Paradoks dokładnościPrzy niezbalansowanych klasach model, który zawsze przewiduje klasę większościową, ma wysoką dokładność i jest bezużyteczny. Dlaczego i czym to mierzyć.Błąd zaniedbania stopy bazowej InteraktywneTrafny test przy rzadkim zjawisku daje głównie fałszywe alarmy, bo zdrowych jest dużo więcej niż chorych. Dlaczego ludzie i modele o tym zapominają.Błąd prokuratora InteraktywneMylenie prawdopodobieństwa dowodu przy niewinności z prawdopodobieństwem niewinności przy dowodzie. Dlaczego „1 na milion” nie znaczy „winny na 99,9999%”.Zasada Pareto (80/20)W wielu zjawiskach niewielka część przyczyn odpowiada za większość skutków. Skąd bierze się ta nierówność i kiedy 80/20 jest prawdą, a kiedy sloganem.Mądrość tłumu i twierdzenie Condorceta InteraktywneWiększość niezależnych głosujących, z których każdy ma rację częściej niż w połowie przypadków, myli się coraz rzadziej. Na tym opierają się zespoły modeli.Uczenie na skróty (shortcut learning)Model uczy się najprostszej reguły, która działa na danych treningowych — często przypadkowego śladu zamiast właściwej cechy — i zawodzi, gdy ten ślad znika.