Ścieżka nauki · początkujący · 12 kroków · ok. 48 min
Uczenie maszynowe od zera
Pierwsze kroki: czym jest uczenie maszynowe, jak model uczy się na danych, jak działa gradient i jak sprawdzić, czy model nie wkuł danych na pamięć.
- Czym jest uczenie maszynowe4 min
Uczenie maszynowe to budowanie programów, które regułę wyprowadzają z przykładów, zamiast dostać ją od programisty. Liczy się trafność na nowych danych.
- Uczenie nadzorowane a nienadzorowane4 min
W uczeniu nadzorowanym model dostaje przykłady z poprawnymi odpowiedziami, w nienadzorowanym tylko surowe dane i sam szuka w nich struktury.
- Zbiór treningowy4 min
Zbiór treningowy to przykłady z poprawnymi odpowiedziami, na których model dopasowuje wagi. Model zakłada, że nowe dane mają ten sam rozkład i proporcje klas.
- Podział na zbiór treningowy i testowy4 min
Zbiór testowy to dane, których model nie widział, więc mierzy działanie na nowych przypadkach. Podział ma naśladować użycie: losowo, warstwowo lub w czasie.
- Regresja liniowa4 min
Regresja liniowa przewiduje liczbę jako ważoną sumę cech plus stałą. Wagi dobiera metodą najmniejszych kwadratów, a każda mówi o wpływie cechy.
- Funkcja straty (loss)4 min
Funkcja straty to jedna liczba mierząca, jak bardzo przewidywania modelu odbiegają od prawdy na danych treningowych. Trening polega na jej minimalizowaniu.
- Gradient i spadek gradientu4 min
Gradient to wektor pochodnych straty po wagach, wskazujący kierunek jej najszybszego wzrostu. Spadek gradientu przesuwa wagi małymi krokami w przeciwną stronę.
- Regresja logistyczna4 min
Regresja logistyczna to model klasyfikacji, który ważoną sumę cech zamienia funkcją sigmoidalną w prawdopodobieństwo. Wagi czyta się jako ilorazy szans.
- Granica decyzyjna4 min
Granica decyzyjna to miejsce w przestrzeni cech, gdzie klasyfikator zmienia zdanie. Jej kształt zdradza założenia modelu i jego skłonność do przeuczenia.
- Drzewo decyzyjne4 min
Drzewo decyzyjne klasyfikuje przykład serią pytań tak/nie o pojedyncze cechy („wiek ≤ 6,5?”) aż do liścia z decyzją. Dzieli przestrzeń cech na prostokąty.
- Przeuczenie i niedouczenie4 min
Przeuczony model zapamiętuje szum ze zbioru treningowego i gorzej działa na nowych danych, a niedouczony jest za prosty, by uchwycić nawet główny wzorzec.
- Walidacja krzyżowa4 min
Walidacja krzyżowa dzieli dane na k części i każdą z nich po kolei traktuje jako zbiór walidacyjny. Daje stabilniejszą ocenę modelu niż jeden podział.