ML Atlas

Dział 05 · 17 haseł

Uczenie bez nadzoru

Klastrowanie, redukcja wymiaru, PCA i wykrywanie anomalii: szukanie struktury w danych bez etykiet.

  1. Uczenie nienadzorowane InteraktywneUczenie bez etykiet: algorytm sam szuka w danych grup, ukrytych kierunków i nietypowych punktów. Wynik zależy od kryterium i od tego, jak opiszesz dane.
  2. K-means InteraktywneK-means dzieli punkty na k grup: każdy punkt trafia do najbliższego środka, a środki przesuwają się do średniej swojej grupy. Zwraca k grup, nawet gdy ich brak.
  3. Pułapki metody k-średnich InteraktywneK-średnich zawsze zwróci k grup, nawet bez sensu. Psują go skale cech, złe ziarno startowe, wydłużone i nierówne skupiska oraz źle dobrane k.
  4. Współczynnik silhouette InteraktywneSilhouette porównuje, jak blisko punkt jest własnego klastra, a jak blisko najbliższego obcego. Ocenia konkretny podział, nie dane — dlatego zmienia się z k.
  5. Klasteryzacja hierarchicznaKlasteryzacja hierarchiczna łączy punkty krok po kroku w coraz większe grupy i rysuje z tego drzewo – dendrogram. Liczbę grup wybierasz dopiero na końcu.
  6. DBSCAN — klasteryzacja gęstościowaDBSCAN łączy w grupy obszary gęsto upakowanych punktów, a rzadkie punkty oznacza jako szum. Znajduje skupiska dowolnego kształtu bez podawania ich liczby.
  7. K-średnich czy DBSCANK-średnich dzieli dane na k zwartych, kulistych grup i przypisuje każdy punkt. DBSCAN szuka gęstych obszarów dowolnego kształtu i odrzuca punkty-szum.
  8. Mieszanina gaussowska i algorytm EMMieszanina gaussowska zakłada, że dane pochodzą z kilku rozkładów normalnych. Algorytm EM na zmianę zgaduje przynależność punktów i poprawia rozkłady.
  9. Analiza głównych składowych (PCA) InteraktywnePCA obraca układ współrzędnych tak, by pierwsze osie łapały jak najwięcej zmienności danych. Pozwala zastąpić wiele skorelowanych cech kilkoma nowymi.
  10. Pułapki PCA InteraktywnePCA łatwo zepsuć: brak standaryzacji, mylenie wariancji z ważnością, wyciek danych, nadinterpretacja ładunków i liniowość tam, gdzie struktura jest zakrzywiona.
  11. t-SNE — mapy danych w 2Dt-SNE rysuje dane wielowymiarowe na płaszczyźnie tak, by bliscy sąsiedzi zostali blisko. Dobrze pokazuje skupiska, ale odległości i rozmiary grup mylą.
  12. UMAP — redukcja wymiaruUMAP buduje graf najbliższych sąsiadów i układa go na płaszczyźnie. Daje mapy jak t-SNE, jest szybszy i rzutuje nowe punkty, ale ma te same pułapki.
  13. PCA, t-SNE czy UMAPPCA to szybki, liniowy rzut zachowujący wariancję, dobry do potoków. t-SNE i UMAP to nieliniowe mapy do oglądania sąsiedztw, nie do mierzenia odległości.
  14. AutoenkoderAutoenkoder to sieć, która uczy się odtwarzać własne wejście przez wąskie gardło. Kod w gardle to skompresowany opis danych, nieliniowe uogólnienie PCA.
  15. Wykrywanie anomaliiWykrywanie anomalii szuka obserwacji, które nie pasują do reszty danych, zwykle bez etykiet. Działa tylko wtedy, gdy anomalie są rzadkie i naprawdę odmienne.
  16. Uczenie półnadzorowaneUczenie półnadzorowane łączy kilka opisanych przykładów z mnóstwem nieopisanych. Działa, gdy granice klas biegną przez rzadkie obszary danych.
  17. Uczenie samonadzorowaneUczenie samonadzorowane tworzy etykiety z samych danych: zakrywa fragment i każe go odgadnąć. Tak uczą się modele językowe i wizyjne bez ręcznego opisywania.

Inne działy

01 Podstawy02 Dane03 Nadzorowane04 Ocena06 Sieci07 Architektury08 LLM09 Wzmocnienie10 Praktyka11 Prawa i prawdy