ML Atlas

Dział 01 · 27 haseł

Podstawy: matematyka i statystyka

Prawdopodobieństwo, rozkłady, średnia i wariancja, gradient i optymalizacja — język, w którym zapisane jest całe uczenie maszynowe.

  1. Wektory i przestrzenie wektoroweWektor to uporządkowana lista liczb, którą można dodawać i skalować. W ML każdy przykład jest punktem w przestrzeni cech, a podobieństwo staje się odległością.
  2. Iloczyn skalarny i podobieństwo kosinusowe InteraktywneIloczyn skalarny mierzy, jak bardzo dwa wektory wskazują w tę samą stronę. Podzielony przez ich długości daje podobieństwo kosinusowe od −1 do 1.
  3. Macierze jako przekształceniaMacierz to przepis na przekształcenie przestrzeni: obraca, rozciąga, rzutuje. Mnożenie macierzy przez wektor przenosi punkt, a warstwa sieci robi to samo.
  4. Wektory i wartości własne InteraktywneWektor własny to kierunek, który macierz tylko rozciąga, nie obracając go. Wartość własna mówi, jak mocno. Na tym opiera się PCA i analiza dynamiki.
  5. Rozkład według wartości osobliwych (SVD)SVD rozkłada dowolną macierz na obrót, skalowanie i obrót. Obcięcie najmniejszych wartości osobliwych daje najlepsze możliwe przybliżenie niskiego rzędu.
  6. Pochodna InteraktywnePochodna mówi, jak szybko zmienia się wynik funkcji przy małej zmianie wejścia. W ML wskazuje, w którą stronę i jak mocno poprawić parametr modelu.
  7. Reguła łańcuchowa InteraktywneReguła łańcuchowa mówi, że pochodna funkcji złożonej to iloczyn pochodnych jej ogniw. Dzięki niej sieć wie, jak każda waga wpływa na błąd na końcu.
  8. Gradient i spadek gradientu InteraktywneGradient to wektor pochodnych straty po wagach, wskazujący kierunek jej najszybszego wzrostu. Spadek gradientu przesuwa wagi małymi krokami w przeciwną stronę.
  9. Minimum lokalne i globalneMinimum lokalne to dolina krajobrazu straty, z której gradient nie wyprowadzi; globalne to najgłębsza. W dużych sieciach problemem są raczej siodła niż pułapki.
  10. Podstawy prawdopodobieństwa InteraktywnePrawdopodobieństwo to liczba od 0 do 1 mierząca, jak bardzo możliwe jest zdarzenie. Trzy proste aksjomaty dają reguły dopełnienia, sumy i niezależności.
  11. Prawdopodobieństwo warunkowe InteraktywnePrawdopodobieństwo warunkowe P(A|B) to szansa zdarzenia A, gdy wiemy, że zaszło B. To zawężenie świata do przypadków B — i nie wolno go odwracać bez Bayesa.
  12. Twierdzenie Bayesa InteraktywneTwierdzenie Bayesa odwraca warunek: z P(dowód|hipoteza) liczy P(hipoteza|dowód), łącząc siłę dowodu z tym, jak częsta była hipoteza przed jego poznaniem.
  13. Zmienne losowe i rozkładyZmienna losowa przypisuje liczbę wynikowi losowego zjawiska, a jej rozkład mówi, jak prawdopodobne są poszczególne wartości. To most między danymi a modelem.
  14. Rozkład normalnyRozkład normalny to symetryczna krzywa dzwonowa opisana średnią i odchyleniem standardowym. Pojawia się tam, gdzie wynik jest sumą wielu drobnych wpływów.
  15. Wartość oczekiwana i wariancjaWartość oczekiwana to średnia, wokół której skupia się zmienna losowa, a wariancja mierzy, jak szeroko wartości rozrzucają się wokół tej średniej.
  16. Kowariancja i korelacja InteraktywneKowariancja mówi, czy dwie zmienne rosną razem, ale zależy od jednostek. Korelacja to kowariancja przeskalowana do zakresu od −1 do 1.
  17. Próbkowanie i błąd standardowy InteraktywneBłąd standardowy mówi, jak bardzo wynik z próby zmieniałby się przy ponownym losowaniu. Maleje jak 1/√n: czterokrotnie większa próba to połowa błędu.
  18. Przedział ufności InteraktywnePrzedział ufności to zakres wyliczony z próby metodą, która w 95% powtórzeń obejmuje prawdziwy parametr. Pokazuje, jak dokładny jest wynik.
  19. Bootstrap InteraktywneBootstrap szacuje niepewność dowolnej statystyki, losując ze zwracaniem wiele nowych prób z danych i patrząc, jak bardzo zmienia się jej wartość.
  20. Testowanie hipotez i wartość p InteraktywneTest hipotez sprawdza, czy dane byłyby zaskakujące, gdyby efektu nie było. Wartość p mierzy to zaskoczenie, ale nie mówi, czy efekt jest prawdziwy ani duży.
  21. Problem wielokrotnych porównań InteraktywneIm więcej testów robisz, tym pewniejsze są fałszywe odkrycia. Korekty Bonferroniego, Holma i Benjaminiego–Hochberga przywracają kontrolę nad błędami.
  22. Metoda największej wiarygodności InteraktywneMetoda największej wiarygodności wybiera parametry, przy których zaobserwowane dane są najbardziej prawdopodobne. Z niej biorą się MSE i entropia krzyżowa.
  23. Wnioskowanie bayesowskieWnioskowanie bayesowskie traktuje parametry jak niepewne wielkości: łączy wiedzę a priori z danymi i daje pełny rozkład a posteriori zamiast jednej liczby.
  24. Entropia i dywergencja KLEntropia mierzy średnią niepewność rozkładu w bitach. Dywergencja KL mówi, ile bitów tracimy, opisując dane rozkładem Q zamiast prawdziwego rozkładu P.
  25. Entropia krzyżowa (log loss) InteraktywneEntropia krzyżowa karze model ujemnym logarytmem prawdopodobieństwa danego poprawnej odpowiedzi. Nagradza uczciwe prawdopodobieństwa, nie same trafienia.
  26. Wnioskowanie przyczynoweWnioskowanie przyczynowe pyta, co się stanie po interwencji, a nie co z czym współwystępuje. Wymaga eksperymentu albo jawnych założeń o zakłóceniach.
  27. Testy A/B InteraktywneTest A/B losowo dzieli użytkowników na dwie wersje i porównuje wyniki. Losowanie daje efekt przyczynowy, a wielkość próby trzeba ustalić przed startem.

Inne działy

02 Dane03 Nadzorowane04 Ocena05 Bez nadzoru06 Sieci07 Architektury08 LLM09 Wzmocnienie10 Praktyka11 Prawa i prawdy