ML Atlas

Ścieżka nauki · średni · 14 kroków · ok. 56 min

Jak uczy się sieć neuronowa

Od pojedynczego neuronu do sieci, która się uczy: aktywacje, softmax, entropia krzyżowa, propagacja wsteczna, optymalizatory i walka z przeuczeniem.

  1. Perceptron (sztuczny neuron)4 min

    Perceptron to najprostszy sztuczny neuron: liczy sumę ważoną wejść plus bias i zwraca 1, gdy przekracza ona zero. Dzieli przestrzeń cech hiperpłaszczyzną.

  2. Funkcja aktywacji (ReLU, sigmoid, tanh)4 min

    Funkcja aktywacji to nieliniowość nakładana na sumę ważoną neuronu. Bez niej sieć wielowarstwowa jest liniowa, a jej kształt decyduje o przepływie gradientu.

  3. Perceptron wielowarstwowy (MLP)5 min

    MLP to sieć neuronowa z warstwami ukrytymi: każda składa sumy ważone i nieliniowość, dzięki czemu sieć uczy się zależności, których model liniowy nie uchwyci.

  4. Przejście w przód (forward pass)4 min

    Przejście w przód to obliczenie wyniku sieci: dane płyną warstwa po warstwie przez mnożenie przez wagi i funkcje aktywacji, aż do predykcji i straty.

  5. Softmax4 min

    Softmax zamienia wektor logitów na rozkład prawdopodobieństwa: każdy wynik podnosi do e^z i dzieli przez sumę, więc wyjścia są dodatnie i sumują się do 1.

  6. Entropia krzyżowa (log loss)4 min

    Entropia krzyżowa karze model ujemnym logarytmem prawdopodobieństwa danego poprawnej odpowiedzi. Nagradza uczciwe prawdopodobieństwa, nie same trafienia.

  7. Propagacja wsteczna (backpropagation)4 min

    Propagacja wsteczna liczy, jak strata zależy od każdej wagi sieci, przesyłając sygnał błędu od wyjścia do wejścia zgodnie z regułą łańcuchową.

  8. Learning rate (współczynnik uczenia)4 min

    Learning rate to współczynnik skalujący krok wzdłuż ujemnego gradientu przy aktualizacji wag. Za mały spowalnia trening, za duży daje oscylacje i rozbieżność.

  9. Mini-batch i rozmiar batcha4 min

    Mini-batch to porcja przykładów, na której liczy się jeden gradient i robi jeden krok. Mały batch daje szumny, częsty krok; duży gładki, ale rzadszy i droższy.

  10. Optymalizatory: SGD, momentum, Adam4 min

    Optymalizator zamienia gradient na krok. SGD idzie wzdłuż gradientu, momentum dodaje rozpęd, a Adam skaluje krok każdej wagi jej typowym gradientem.

  11. Zanikający i eksplodujący gradient4 min

    Gradient w głębokiej sieci to iloczyn czynników z kolejnych warstw: gdy są mniejsze od 1, zanika, gdy większe, rośnie wykładniczo i wagi uciekają do NaN.

  12. Regularyzacja (L2, dropout, early stopping)4 min

    Regularyzacja ogranicza dopasowanie modelu do szumu: kara za duże wagi (L2), losowe wyłączanie neuronów (dropout) i wcześniejszy koniec treningu.

  13. Dropout4 min

    Dropout w czasie treningu losowo wyłącza część neuronów, więc sieć nie może polegać na pojedynczych połączeniach i lepiej uogólnia na nowe dane.

  14. Wczesne zatrzymanie (early stopping)3 min

    Early stopping kończy trening, gdy strata walidacyjna przestaje spadać, i wraca do najlepszych wag. Działa jak regularyzacja, ale wymaga cierpliwości.

Inne ścieżki

Uczenie maszynowe od zeraModele językowe i transformeryJak uczciwie ocenić modelDane tabelaryczne i Kaggle