ML Atlas

Dział 06 · 32 hasła

Sieci neuronowe

Neuron, warstwy, funkcje aktywacji, propagacja wsteczna, learning rate, optymalizatory i regularyzacja — jak uczy się sieć.

  1. Perceptron (sztuczny neuron)Perceptron to najprostszy sztuczny neuron: liczy sumę ważoną wejść plus bias i zwraca 1, gdy przekracza ona zero. Dzieli przestrzeń cech hiperpłaszczyzną.
  2. Funkcja aktywacji (ReLU, sigmoid, tanh) InteraktywneFunkcja aktywacji to nieliniowość nakładana na sumę ważoną neuronu. Bez niej sieć wielowarstwowa jest liniowa, a jej kształt decyduje o przepływie gradientu.
  3. Perceptron wielowarstwowy (MLP) InteraktywneMLP to sieć neuronowa z warstwami ukrytymi: każda składa sumy ważone i nieliniowość, dzięki czemu sieć uczy się zależności, których model liniowy nie uchwyci.
  4. Warstwa ukryta InteraktywneWarstwa ukryta to neurony między wejściem a wyjściem sieci. Każdy uczy się cechy pośredniej, dzięki czemu sieć rysuje granice, których jedna prosta nie da.
  5. Szerokość warstwySzerokość warstwy to liczba jej neuronów, czyli część pojemności sieci. Za mało — sieć nie wyrazi reguły; za dużo — rośnie koszt i ryzyko uczenia się szumu.
  6. Aproksymacja odcinkami liniowa (ReLU)Neuron ReLU to funkcja z jednym zagięciem: zero, a od pewnego miejsca prosta. Suma kilku przesuniętych zagięć daje łamaną — rampę, schodek, dowolny kształt.
  7. Problem XORXOR to najprostsze zadanie, którego nie rozwiąże żaden model liniowy. Pokazuje, po co sieciom warstwa ukryta i nieliniowa funkcja aktywacji.
  8. Przejście w przód (forward pass) InteraktywnePrzejście w przód to obliczenie wyniku sieci: dane płyną warstwa po warstwie przez mnożenie przez wagi i funkcje aktywacji, aż do predykcji i straty.
  9. Softmax InteraktywneSoftmax zamienia wektor logitów na rozkład prawdopodobieństwa: każdy wynik podnosi do e^z i dzieli przez sumę, więc wyjścia są dodatnie i sumują się do 1.
  10. Propagacja wsteczna (backpropagation) InteraktywnePropagacja wsteczna liczy, jak strata zależy od każdej wagi sieci, przesyłając sygnał błędu od wyjścia do wejścia zgodnie z regułą łańcuchową.
  11. Automatyczne różniczkowanie (autograd) InteraktywneAutomatyczne różniczkowanie liczy dokładne pochodne programu: rozkłada go na proste operacje i łączy ich pochodne regułą łańcuchową, bez wzorów i przybliżeń.
  12. Krajobraz funkcji stratyKrajobraz straty to wartość błędu jako funkcja wszystkich wag sieci. Jego kształt wyjaśnia, dlaczego trening działa mimo niewypukłości i od czego zależy wynik.
  13. Learning rate (współczynnik uczenia) InteraktywneLearning rate to współczynnik skalujący krok wzdłuż ujemnego gradientu przy aktualizacji wag. Za mały spowalnia trening, za duży daje oscylacje i rozbieżność.
  14. Harmonogramy współczynnika uczeniaHarmonogram zmienia współczynnik uczenia w trakcie treningu: duże kroki na początku przyspieszają postęp, małe na końcu pozwalają osiąść w minimum.
  15. Mini-batch i rozmiar batchaMini-batch to porcja przykładów, na której liczy się jeden gradient i robi jeden krok. Mały batch daje szumny, częsty krok; duży gładki, ale rzadszy i droższy.
  16. Jak dobrać rozmiar minipaczkiZacznij od minipaczki 32–256 albo od największej, jaka mieści się w pamięci. Większa paczka to mniej kroków: podnieś współczynnik uczenia lub liczbę epok.
  17. Epoka treningu InteraktywneEpoka to jedno pełne przejście algorytmu uczącego przez cały zbiór treningowy. Trening składa się z wielu epok, bo jeden krok zmienia wagi tylko trochę.
  18. Optymalizatory: SGD, momentum, Adam InteraktywneOptymalizator zamienia gradient na krok. SGD idzie wzdłuż gradientu, momentum dodaje rozpęd, a Adam skaluje krok każdej wagi jej typowym gradientem.
  19. SGD czy Adam — który optymalizatorAdam szybciej zbiega i wybacza zły współczynnik uczenia, więc to dobry wybór domyślny. SGD z momentem po dostrojeniu mu dorównuje, a bywa lepszy w uogólnianiu.
  20. Inicjalizacja wag InteraktywneInicjalizacja wag to wybór wartości startowych przed treningiem. Losowy start łamie symetrię neuronów, a skala Xavier lub He trzyma sygnał w rozsądnym zakresie.
  21. Losowy seed i szczęśliwa inicjalizacjaLosowe wagi startowe dają przypadkową granicę decyzji, która czasem trafia blisko prawdziwej. Wynik zależy od seeda: jeden przebieg to jedno losowanie.
  22. Zanikający i eksplodujący gradient InteraktywneGradient w głębokiej sieci to iloczyn czynników z kolejnych warstw: gdy są mniejsze od 1, zanika, gdy większe, rośnie wykładniczo i wagi uciekają do NaN.
  23. Martwe neurony ReLU i nasycenie InteraktywneNeuron nasycony (sigmoid lub tanh na skraju) albo martwy (ReLU zawsze poniżej zera) ma gradient bliski zeru, więc przestaje się uczyć, choć zajmuje miejsce.
  24. Normalizacja wsadowa i warstwowa InteraktywneNormalizacja wsadowa i warstwowa sprowadzają aktywacje neuronów do średniej 0 i wariancji 1, co stabilizuje i przyspiesza trening głębokich sieci.
  25. Regularyzacja (L2, dropout, early stopping) InteraktywneRegularyzacja ogranicza dopasowanie modelu do szumu: kara za duże wagi (L2), losowe wyłączanie neuronów (dropout) i wcześniejszy koniec treningu.
  26. Dropout InteraktywneDropout w czasie treningu losowo wyłącza część neuronów, więc sieć nie może polegać na pojedynczych połączeniach i lepiej uogólnia na nowe dane.
  27. Wczesne zatrzymanie (early stopping)Early stopping kończy trening, gdy strata walidacyjna przestaje spadać, i wraca do najlepszych wag. Działa jak regularyzacja, ale wymaga cierpliwości.
  28. Niemonotoniczność treninguTrafność treningowa nie musi rosnąć monotonicznie: krok gradientu obniża stratę średnio, ale może zepsuć pojedyncze przykłady, bo wszystkie dzielą te same wagi.
  29. Pojemność sieci neuronowej InteraktywnePojemność sieci to zakres funkcji, jakie może ona odwzorować. Za mała nie uchwyci wzorca, duża zapamięta nawet losowe etykiety, a mimo to potrafi uogólniać.
  30. Katastrofalne zapominanieKatastrofalne zapominanie to utrata starej wiedzy, gdy sieć trenuje się tylko na nowym zadaniu. Replay miesza stare przykłady z nowymi, by gradient dbał o oba.
  31. Embeddingi (osadzenia) InteraktywneEmbedding to wektor liczb reprezentujący obiekt, np. słowo, produkt czy obraz, tak że obiekty podobne dla zadania leżą blisko siebie w przestrzeni.
  32. Przykłady kontradyktoryjnePrzykład kontradyktoryjny to wejście zmienione niemal niezauważalnie, lecz celowo tak, by model się pomylił. Ujawnia, że sieci opierają się na kruchych cechach.

Inne działy

01 Podstawy02 Dane03 Nadzorowane04 Ocena05 Bez nadzoru07 Architektury08 LLM09 Wzmocnienie10 Praktyka11 Prawa i prawdy