ML Atlas

Ścieżka nauki · początkujący · 12 kroków · ok. 48 min

Uczenie maszynowe od zera

Pierwsze kroki: czym jest uczenie maszynowe, jak model uczy się na danych, jak działa gradient i jak sprawdzić, czy model nie wkuł danych na pamięć.

  1. Czym jest uczenie maszynowe4 min

    Uczenie maszynowe to budowanie programów, które regułę wyprowadzają z przykładów, zamiast dostać ją od programisty. Liczy się trafność na nowych danych.

  2. Uczenie nadzorowane a nienadzorowane4 min

    W uczeniu nadzorowanym model dostaje przykłady z poprawnymi odpowiedziami, w nienadzorowanym tylko surowe dane i sam szuka w nich struktury.

  3. Zbiór treningowy4 min

    Zbiór treningowy to przykłady z poprawnymi odpowiedziami, na których model dopasowuje wagi. Model zakłada, że nowe dane mają ten sam rozkład i proporcje klas.

  4. Podział na zbiór treningowy i testowy4 min

    Zbiór testowy to dane, których model nie widział, więc mierzy działanie na nowych przypadkach. Podział ma naśladować użycie: losowo, warstwowo lub w czasie.

  5. Regresja liniowa4 min

    Regresja liniowa przewiduje liczbę jako ważoną sumę cech plus stałą. Wagi dobiera metodą najmniejszych kwadratów, a każda mówi o wpływie cechy.

  6. Funkcja straty (loss)4 min

    Funkcja straty to jedna liczba mierząca, jak bardzo przewidywania modelu odbiegają od prawdy na danych treningowych. Trening polega na jej minimalizowaniu.

  7. Gradient i spadek gradientu4 min

    Gradient to wektor pochodnych straty po wagach, wskazujący kierunek jej najszybszego wzrostu. Spadek gradientu przesuwa wagi małymi krokami w przeciwną stronę.

  8. Regresja logistyczna4 min

    Regresja logistyczna to model klasyfikacji, który ważoną sumę cech zamienia funkcją sigmoidalną w prawdopodobieństwo. Wagi czyta się jako ilorazy szans.

  9. Granica decyzyjna4 min

    Granica decyzyjna to miejsce w przestrzeni cech, gdzie klasyfikator zmienia zdanie. Jej kształt zdradza założenia modelu i jego skłonność do przeuczenia.

  10. Drzewo decyzyjne4 min

    Drzewo decyzyjne klasyfikuje przykład serią pytań tak/nie o pojedyncze cechy („wiek ≤ 6,5?”) aż do liścia z decyzją. Dzieli przestrzeń cech na prostokąty.

  11. Przeuczenie i niedouczenie4 min

    Przeuczony model zapamiętuje szum ze zbioru treningowego i gorzej działa na nowych danych, a niedouczony jest za prosty, by uchwycić nawet główny wzorzec.

  12. Walidacja krzyżowa4 min

    Walidacja krzyżowa dzieli dane na k części i każdą z nich po kolei traktuje jako zbiór walidacyjny. Daje stabilniejszą ocenę modelu niż jeden podział.

Inne ścieżki

Jak uczy się sieć neuronowaModele językowe i transformeryJak uczciwie ocenić modelDane tabelaryczne i Kaggle