Ścieżka nauki · średni · 14 kroków · ok. 56 min
Jak uczy się sieć neuronowa
Od pojedynczego neuronu do sieci, która się uczy: aktywacje, softmax, entropia krzyżowa, propagacja wsteczna, optymalizatory i walka z przeuczeniem.
- Perceptron (sztuczny neuron)4 min
Perceptron to najprostszy sztuczny neuron: liczy sumę ważoną wejść plus bias i zwraca 1, gdy przekracza ona zero. Dzieli przestrzeń cech hiperpłaszczyzną.
- Funkcja aktywacji (ReLU, sigmoid, tanh)4 min
Funkcja aktywacji to nieliniowość nakładana na sumę ważoną neuronu. Bez niej sieć wielowarstwowa jest liniowa, a jej kształt decyduje o przepływie gradientu.
- Perceptron wielowarstwowy (MLP)5 min
MLP to sieć neuronowa z warstwami ukrytymi: każda składa sumy ważone i nieliniowość, dzięki czemu sieć uczy się zależności, których model liniowy nie uchwyci.
- Przejście w przód (forward pass)4 min
Przejście w przód to obliczenie wyniku sieci: dane płyną warstwa po warstwie przez mnożenie przez wagi i funkcje aktywacji, aż do predykcji i straty.
- Softmax4 min
Softmax zamienia wektor logitów na rozkład prawdopodobieństwa: każdy wynik podnosi do e^z i dzieli przez sumę, więc wyjścia są dodatnie i sumują się do 1.
- Entropia krzyżowa (log loss)4 min
Entropia krzyżowa karze model ujemnym logarytmem prawdopodobieństwa danego poprawnej odpowiedzi. Nagradza uczciwe prawdopodobieństwa, nie same trafienia.
- Propagacja wsteczna (backpropagation)4 min
Propagacja wsteczna liczy, jak strata zależy od każdej wagi sieci, przesyłając sygnał błędu od wyjścia do wejścia zgodnie z regułą łańcuchową.
- Learning rate (współczynnik uczenia)4 min
Learning rate to współczynnik skalujący krok wzdłuż ujemnego gradientu przy aktualizacji wag. Za mały spowalnia trening, za duży daje oscylacje i rozbieżność.
- Mini-batch i rozmiar batcha4 min
Mini-batch to porcja przykładów, na której liczy się jeden gradient i robi jeden krok. Mały batch daje szumny, częsty krok; duży gładki, ale rzadszy i droższy.
- Optymalizatory: SGD, momentum, Adam4 min
Optymalizator zamienia gradient na krok. SGD idzie wzdłuż gradientu, momentum dodaje rozpęd, a Adam skaluje krok każdej wagi jej typowym gradientem.
- Zanikający i eksplodujący gradient4 min
Gradient w głębokiej sieci to iloczyn czynników z kolejnych warstw: gdy są mniejsze od 1, zanika, gdy większe, rośnie wykładniczo i wagi uciekają do NaN.
- Regularyzacja (L2, dropout, early stopping)4 min
Regularyzacja ogranicza dopasowanie modelu do szumu: kara za duże wagi (L2), losowe wyłączanie neuronów (dropout) i wcześniejszy koniec treningu.
- Dropout4 min
Dropout w czasie treningu losowo wyłącza część neuronów, więc sieć nie może polegać na pojedynczych połączeniach i lepiej uogólnia na nowe dane.
- Wczesne zatrzymanie (early stopping)3 min
Early stopping kończy trening, gdy strata walidacyjna przestaje spadać, i wraca do najlepszych wag. Działa jak regularyzacja, ale wymaga cierpliwości.