Dział 11 · 45 haseł
Prawa i prawdy
Twierdzenia, paradoksy i twarde prawdy uczenia maszynowego: No Free Lunch, kompromis obciążenie–wariancja, Simpson, Goodhart, klątwa wymiarowości i inne.
- Twierdzenie „nie ma darmowego lunchu”Uśredniony po wszystkich możliwych problemach żaden algorytm uczenia nie jest lepszy od innego. Przewaga zawsze bierze się z założeń dopasowanych do danych.
- Kompromis obciążenie–wariancja InteraktywneBłąd modelu na nowych danych rozkłada się na obciążenie, wariancję i szum. Prostszy model ma większe obciążenie, bogatszy — większą wariancję.
- Podwójne zejście (double descent) InteraktywneBłąd testowy rośnie, gdy model ledwo mieści dane treningowe, a potem znów spada, gdy parametrów jest znacznie więcej niż przykładów.
- Przekleństwo wymiarowości InteraktywneWraz z liczbą wymiarów przestrzeń pustoszeje wykładniczo, a odległości między punktami stają się prawie równe. Metody oparte na sąsiedztwie tracą sens.
- Zjawisko Hughesa InteraktywnePrzy stałej liczbie przykładów dokładność klasyfikatora najpierw rośnie z liczbą cech, a potem spada, bo parametrów do oszacowania przybywa szybciej niż danych.
- Brzytwa Ockhama w uczeniu maszynowymSpośród modeli równie dobrze wyjaśniających dane wybieraj prostszy. W ML to rozsądna heurystyka chroniąca przed przeuczeniem, ale nie twarde prawo.
- Wszystkie modele są błędneKażdy model jest uproszczeniem i w jakimś sensie fałszywy. Pytanie nie brzmi „czy jest prawdziwy”, tylko „czy jest wystarczająco dobry do tego celu”.
- Śmieci na wejściu, śmieci na wyjściuModel nie będzie lepszy niż dane, z których się uczy: błędne etykiety, stronnicza próbka i zbędne cechy przechodzą wprost do predykcji. Dlaczego tak jest.
- Wyciek danych (data leakage) InteraktywneWyciek danych to sytuacja, w której model w treningu lub walidacji dostaje informację niedostępną w chwili prawdziwej prognozy. Daje zawyżone wyniki.
- Prawo Goodharta InteraktywneGdy miara staje się celem, przestaje być dobrą miarą. W ML optymalizowanie zastępczej metryki rozjeżdża ją z tym, na czym naprawdę nam zależy.
- Przeuczenie do tablicy wyników InteraktywnePoprawianie modelu pod wynik na publicznej tablicy dopasowuje go do szumu tej małej próbki. Na zbiorze prywatnym wynik spada, a ranking się tasuje.
- Klątwa zwycięzcy InteraktywneWynik kandydata wybranego jako najlepszy na tych samych danych jest zawyżony, bo wybór faworyzuje korzystny szum pomiaru. Na nowych danych szczęście znika.
- Selekcja na szumnym pomiarze InteraktywneZysk z selekcji to pozorna przewaga wybranych pomnożona przez rzetelność pomiaru. Gdy miara to głównie szum, wybór najlepszych nagradza szczęście.
- Paradoks dokładnościPrzy niezbalansowanych klasach model, który zawsze przewiduje klasę większościową, ma wysoką dokładność i jest bezużyteczny. Dlaczego i czym to mierzyć.
- Prawo wielkich liczb InteraktywneŚrednia z coraz większej liczby niezależnych prób zbliża się do wartości oczekiwanej. Wyjaśniamy, dlaczego tak jest i czego to prawo nie obiecuje.
- Centralne twierdzenie graniczne InteraktywneSuma lub średnia wielu niezależnych wartości ma w przybliżeniu rozkład normalny, nawet gdy pojedyncze wartości są skrajnie skośne. Skąd to się bierze.
- Prawo małych liczbLudzie oczekują, że mała próbka będzie wiernym obrazem populacji. Tymczasem małe próbki częściej dają skrajne wyniki, z których wyciągamy fałszywe wnioski.
- Regresja do średniej InteraktywneSkrajny wynik w jednym pomiarze zwykle oznacza też skrajne szczęście, więc kolejny pomiar wypada bliżej średniej. Dlaczego to zjawisko myli badaczy.
- Błąd zaniedbania stopy bazowej InteraktywneTrafny test przy rzadkim zjawisku daje głównie fałszywe alarmy, bo zdrowych jest dużo więcej niż chorych. Dlaczego ludzie i modele o tym zapominają.
- Błąd prokuratora InteraktywneMylenie prawdopodobieństwa dowodu przy niewinności z prawdopodobieństwem niewinności przy dowodzie. Dlaczego „1 na milion” nie znaczy „winny na 99,9999%”.
- Paradoks Simpsona InteraktywneZależność widoczna w całych danych może zniknąć albo się odwrócić po podziale na grupy. Przykład rekrutacji w Berkeley w 1973 roku i wyjaśnienie dlaczego.
- Kwartet Anscombe’a InteraktywneCztery zbiory o identycznych średnich, wariancjach, korelacji i prostej regresji wyglądają na wykresie zupełnie inaczej. Dlaczego statystyki nie wystarczą.
- Paradoks BerksonaGdy do próbki trafiają tylko obiekty spełniające jakiś warunek, niezależne cechy zaczynają wyglądać na ujemnie skorelowane. Skąd to się bierze.
- Błąd przeżywalnościWnioski wyciągane tylko z tych, którzy przetrwali selekcję, są zniekształcone, bo nie widać tych, którzy odpadli. Samoloty Walda i pasażerowie Titanica.
- Błąd ekologicznyZależność między średnimi grup nie musi zachodzić dla pojedynczych osób w tych grupach, a nawet może mieć odwrotny znak. Dlaczego tak się dzieje.
- Korelacja to nie przyczynowośćDwie zmienne mogą iść w parze, bo łączy je wspólna przyczyna, odwrotny kierunek wpływu, selekcja albo przypadek. Jak to rozpoznać i co z tym zrobić.
- Paradoks SteinaPrzy trzech lub więcej szacowanych średnich ściągnięcie wszystkich w stronę wspólnego punktu daje mniejszy łączny błąd niż osobne średnie. Wyjaśniamy dlaczego.
- Prawo BenfordaW wielu zbiorach liczb pierwszą cyfrą jest 1 w około 30% przypadków, a 9 tylko w 5%. Kiedy prawo Benforda działa, dlaczego i kiedy zawodzi.
- Prawo ZipfaCzęstość słowa jest w przybliżeniu odwrotnie proporcjonalna do jego miejsca w rankingu: drugie jest o połowę rzadsze od pierwszego. Co to znaczy dla NLP.
- Zasada Pareto (80/20)W wielu zjawiskach niewielka część przyczyn odpowiada za większość skutków. Skąd bierze się ta nierówność i kiedy 80/20 jest prawdą, a kiedy sloganem.
- Wymiar Vapnika–Czerwonenkisa (VC)Wymiar VC to największa liczba punktów, którym rodzina modeli potrafi nadać dowolne etykiety. Im jest większy, tym więcej danych trzeba do pewnej generalizacji.
- Nierówność HoeffdingaŚrednia z n niezależnych ograniczonych pomiarów rzadko odbiega od wartości oczekiwanej. Szansa odchylenia o ε maleje wykładniczo z n·ε².
- Twierdzenie CoveraProblem klasyfikacji przeniesiony nieliniowo do przestrzeni o wyższym wymiarze staje się z dużym prawdopodobieństwem liniowo separowalny.
- Twierdzenie o zbieżności perceptronuJeśli dane są liniowo separowalne z marginesem γ, perceptron znajdzie granicę bezbłędną po co najwyżej (R/γ)² poprawkach, niezależnie od liczby przykładów.
- Twierdzenie o uniwersalnej aproksymacjiSieć z jedną warstwą ukrytą i dostatecznie wieloma neuronami może dowolnie dokładnie przybliżyć każdą funkcję ciągłą na ograniczonym obszarze.
- Efekt RashomonWiele różnych modeli osiąga prawie identyczną dokładność, a mimo to opowiada odmienne historie o tym, które cechy są ważne i jak działa świat.
- Mądrość tłumu i twierdzenie Condorceta InteraktywneWiększość niezależnych głosujących, z których każdy ma rację częściej niż w połowie przypadków, myli się coraz rzadziej. Na tym opierają się zespoły modeli.
- Hipoteza rozmaitościDane wysokowymiarowe, jak obrazy czy dźwięk, skupiają się blisko powierzchni o znacznie niższym wymiarze. Dlatego uczenie z nich jest w ogóle wykonalne.
- Hipoteza losu na loteriiDuża losowa sieć zawiera małą podsieć, która trenowana od tych samych wag startowych dorównuje całej sieci. Dobrze potwierdzone w małej skali, sporne w dużej.
- Prawa skalowania modeliBłąd dużych modeli maleje jak potęga liczby parametrów, danych i obliczeń. Chinchilla: ok. 20 tokenów na parametr. Ekstrapolacja tych praw jest ryzykowna.
- Gorzka lekcja (Sutton)W historii AI ogólne metody skalujące się z obliczeniami wygrywały z ręcznie wbudowaną wiedzą ludzką. To interpretacja historii, nie twierdzenie, i ma krytyków.
- Paradoks MoravecaTo, co ludziom przychodzi bez wysiłku — widzenie, chodzenie, chwytanie — okazuje się dla maszyn najtrudniejsze, a to, co trudne dla ludzi, bywa dla nich łatwe.
- Uczenie na skróty (shortcut learning)Model uczy się najprostszej reguły, która działa na danych treningowych — często przypadkowego śladu zamiast właściwej cechy — i zawodzi, gdy ten ślad znika.
- Zdolności emergentne modeliNiektóre umiejętności LLM wydają się pojawiać skokowo po przekroczeniu pewnej skali. Część tych skoków może być artefaktem metryki — to zjawisko sporne.
- Zapaść modelu (model collapse)Model trenowany kolejno na danych wygenerowanych przez poprzednie modele traci rzadkie przypadki i różnorodność, aż jego rozkład zapada się do wąskiego wycinka.