Dział 05 · 17 haseł
Uczenie bez nadzoru
Klastrowanie, redukcja wymiaru, PCA i wykrywanie anomalii: szukanie struktury w danych bez etykiet.
- Uczenie nienadzorowane InteraktywneUczenie bez etykiet: algorytm sam szuka w danych grup, ukrytych kierunków i nietypowych punktów. Wynik zależy od kryterium i od tego, jak opiszesz dane.
- K-means InteraktywneK-means dzieli punkty na k grup: każdy punkt trafia do najbliższego środka, a środki przesuwają się do średniej swojej grupy. Zwraca k grup, nawet gdy ich brak.
- Pułapki metody k-średnich InteraktywneK-średnich zawsze zwróci k grup, nawet bez sensu. Psują go skale cech, złe ziarno startowe, wydłużone i nierówne skupiska oraz źle dobrane k.
- Współczynnik silhouette InteraktywneSilhouette porównuje, jak blisko punkt jest własnego klastra, a jak blisko najbliższego obcego. Ocenia konkretny podział, nie dane — dlatego zmienia się z k.
- Klasteryzacja hierarchicznaKlasteryzacja hierarchiczna łączy punkty krok po kroku w coraz większe grupy i rysuje z tego drzewo – dendrogram. Liczbę grup wybierasz dopiero na końcu.
- DBSCAN — klasteryzacja gęstościowaDBSCAN łączy w grupy obszary gęsto upakowanych punktów, a rzadkie punkty oznacza jako szum. Znajduje skupiska dowolnego kształtu bez podawania ich liczby.
- K-średnich czy DBSCANK-średnich dzieli dane na k zwartych, kulistych grup i przypisuje każdy punkt. DBSCAN szuka gęstych obszarów dowolnego kształtu i odrzuca punkty-szum.
- Mieszanina gaussowska i algorytm EMMieszanina gaussowska zakłada, że dane pochodzą z kilku rozkładów normalnych. Algorytm EM na zmianę zgaduje przynależność punktów i poprawia rozkłady.
- Analiza głównych składowych (PCA) InteraktywnePCA obraca układ współrzędnych tak, by pierwsze osie łapały jak najwięcej zmienności danych. Pozwala zastąpić wiele skorelowanych cech kilkoma nowymi.
- Pułapki PCA InteraktywnePCA łatwo zepsuć: brak standaryzacji, mylenie wariancji z ważnością, wyciek danych, nadinterpretacja ładunków i liniowość tam, gdzie struktura jest zakrzywiona.
- t-SNE — mapy danych w 2Dt-SNE rysuje dane wielowymiarowe na płaszczyźnie tak, by bliscy sąsiedzi zostali blisko. Dobrze pokazuje skupiska, ale odległości i rozmiary grup mylą.
- UMAP — redukcja wymiaruUMAP buduje graf najbliższych sąsiadów i układa go na płaszczyźnie. Daje mapy jak t-SNE, jest szybszy i rzutuje nowe punkty, ale ma te same pułapki.
- PCA, t-SNE czy UMAPPCA to szybki, liniowy rzut zachowujący wariancję, dobry do potoków. t-SNE i UMAP to nieliniowe mapy do oglądania sąsiedztw, nie do mierzenia odległości.
- AutoenkoderAutoenkoder to sieć, która uczy się odtwarzać własne wejście przez wąskie gardło. Kod w gardle to skompresowany opis danych, nieliniowe uogólnienie PCA.
- Wykrywanie anomaliiWykrywanie anomalii szuka obserwacji, które nie pasują do reszty danych, zwykle bez etykiet. Działa tylko wtedy, gdy anomalie są rzadkie i naprawdę odmienne.
- Uczenie półnadzorowaneUczenie półnadzorowane łączy kilka opisanych przykładów z mnóstwem nieopisanych. Działa, gdy granice klas biegną przez rzadkie obszary danych.
- Uczenie samonadzorowaneUczenie samonadzorowane tworzy etykiety z samych danych: zakrywa fragment i każe go odgadnąć. Tak uczą się modele językowe i wizyjne bez ręcznego opisywania.