Dział 01 · 27 haseł
Podstawy: matematyka i statystyka
Prawdopodobieństwo, rozkłady, średnia i wariancja, gradient i optymalizacja — język, w którym zapisane jest całe uczenie maszynowe.
- Wektory i przestrzenie wektoroweWektor to uporządkowana lista liczb, którą można dodawać i skalować. W ML każdy przykład jest punktem w przestrzeni cech, a podobieństwo staje się odległością.
- Iloczyn skalarny i podobieństwo kosinusowe InteraktywneIloczyn skalarny mierzy, jak bardzo dwa wektory wskazują w tę samą stronę. Podzielony przez ich długości daje podobieństwo kosinusowe od −1 do 1.
- Macierze jako przekształceniaMacierz to przepis na przekształcenie przestrzeni: obraca, rozciąga, rzutuje. Mnożenie macierzy przez wektor przenosi punkt, a warstwa sieci robi to samo.
- Wektory i wartości własne InteraktywneWektor własny to kierunek, który macierz tylko rozciąga, nie obracając go. Wartość własna mówi, jak mocno. Na tym opiera się PCA i analiza dynamiki.
- Rozkład według wartości osobliwych (SVD)SVD rozkłada dowolną macierz na obrót, skalowanie i obrót. Obcięcie najmniejszych wartości osobliwych daje najlepsze możliwe przybliżenie niskiego rzędu.
- Pochodna InteraktywnePochodna mówi, jak szybko zmienia się wynik funkcji przy małej zmianie wejścia. W ML wskazuje, w którą stronę i jak mocno poprawić parametr modelu.
- Reguła łańcuchowa InteraktywneReguła łańcuchowa mówi, że pochodna funkcji złożonej to iloczyn pochodnych jej ogniw. Dzięki niej sieć wie, jak każda waga wpływa na błąd na końcu.
- Gradient i spadek gradientu InteraktywneGradient to wektor pochodnych straty po wagach, wskazujący kierunek jej najszybszego wzrostu. Spadek gradientu przesuwa wagi małymi krokami w przeciwną stronę.
- Minimum lokalne i globalneMinimum lokalne to dolina krajobrazu straty, z której gradient nie wyprowadzi; globalne to najgłębsza. W dużych sieciach problemem są raczej siodła niż pułapki.
- Podstawy prawdopodobieństwa InteraktywnePrawdopodobieństwo to liczba od 0 do 1 mierząca, jak bardzo możliwe jest zdarzenie. Trzy proste aksjomaty dają reguły dopełnienia, sumy i niezależności.
- Prawdopodobieństwo warunkowe InteraktywnePrawdopodobieństwo warunkowe P(A|B) to szansa zdarzenia A, gdy wiemy, że zaszło B. To zawężenie świata do przypadków B — i nie wolno go odwracać bez Bayesa.
- Twierdzenie Bayesa InteraktywneTwierdzenie Bayesa odwraca warunek: z P(dowód|hipoteza) liczy P(hipoteza|dowód), łącząc siłę dowodu z tym, jak częsta była hipoteza przed jego poznaniem.
- Zmienne losowe i rozkładyZmienna losowa przypisuje liczbę wynikowi losowego zjawiska, a jej rozkład mówi, jak prawdopodobne są poszczególne wartości. To most między danymi a modelem.
- Rozkład normalnyRozkład normalny to symetryczna krzywa dzwonowa opisana średnią i odchyleniem standardowym. Pojawia się tam, gdzie wynik jest sumą wielu drobnych wpływów.
- Wartość oczekiwana i wariancjaWartość oczekiwana to średnia, wokół której skupia się zmienna losowa, a wariancja mierzy, jak szeroko wartości rozrzucają się wokół tej średniej.
- Kowariancja i korelacja InteraktywneKowariancja mówi, czy dwie zmienne rosną razem, ale zależy od jednostek. Korelacja to kowariancja przeskalowana do zakresu od −1 do 1.
- Próbkowanie i błąd standardowy InteraktywneBłąd standardowy mówi, jak bardzo wynik z próby zmieniałby się przy ponownym losowaniu. Maleje jak 1/√n: czterokrotnie większa próba to połowa błędu.
- Przedział ufności InteraktywnePrzedział ufności to zakres wyliczony z próby metodą, która w 95% powtórzeń obejmuje prawdziwy parametr. Pokazuje, jak dokładny jest wynik.
- Bootstrap InteraktywneBootstrap szacuje niepewność dowolnej statystyki, losując ze zwracaniem wiele nowych prób z danych i patrząc, jak bardzo zmienia się jej wartość.
- Testowanie hipotez i wartość p InteraktywneTest hipotez sprawdza, czy dane byłyby zaskakujące, gdyby efektu nie było. Wartość p mierzy to zaskoczenie, ale nie mówi, czy efekt jest prawdziwy ani duży.
- Problem wielokrotnych porównań InteraktywneIm więcej testów robisz, tym pewniejsze są fałszywe odkrycia. Korekty Bonferroniego, Holma i Benjaminiego–Hochberga przywracają kontrolę nad błędami.
- Metoda największej wiarygodności InteraktywneMetoda największej wiarygodności wybiera parametry, przy których zaobserwowane dane są najbardziej prawdopodobne. Z niej biorą się MSE i entropia krzyżowa.
- Wnioskowanie bayesowskieWnioskowanie bayesowskie traktuje parametry jak niepewne wielkości: łączy wiedzę a priori z danymi i daje pełny rozkład a posteriori zamiast jednej liczby.
- Entropia i dywergencja KLEntropia mierzy średnią niepewność rozkładu w bitach. Dywergencja KL mówi, ile bitów tracimy, opisując dane rozkładem Q zamiast prawdziwego rozkładu P.
- Entropia krzyżowa (log loss) InteraktywneEntropia krzyżowa karze model ujemnym logarytmem prawdopodobieństwa danego poprawnej odpowiedzi. Nagradza uczciwe prawdopodobieństwa, nie same trafienia.
- Wnioskowanie przyczynoweWnioskowanie przyczynowe pyta, co się stanie po interwencji, a nie co z czym współwystępuje. Wymaga eksperymentu albo jawnych założeń o zakłóceniach.
- Testy A/B InteraktywneTest A/B losowo dzieli użytkowników na dwie wersje i porównuje wyniki. Losowanie daje efekt przyczynowy, a wielkość próby trzeba ustalić przed startem.