11 · Prawa i prawdy · 4 min czytania · aktualizacja
Czy duże modele językowe naprawdę nabywają nagle nowych umiejętności (emergencja)?
W skrócie
Niektóre umiejętności LLM wydają się pojawiać skokowo po przekroczeniu pewnej skali. Część tych skoków może być artefaktem metryki — to zjawisko sporne.
Co to jest
Zdolność emergentna to umiejętność, której nie widać w mniejszych modelach, a która pojawia się w większych — tak że jej wystąpienia nie da się przewidzieć przez prostą ekstrapolację wyników małych modeli. Taką definicję podali Jason Wei i współautorzy w 2022 roku, zbierając dziesiątki zadań (arytmetyka wielocyfrowa, transliteracja, niektóre zadania z zestawu BIG-bench), w których wynik był bliski losowego aż do pewnej skali, a potem gwałtownie rósł.
Pojęcie nawiązuje do eseju fizyka Philipa Andersona „More Is Different” (1972): ilościowa zmiana może dać jakościowo nowe zachowanie, jak przejście fazowe wody w lód.
Trzeba powiedzieć wprost: to zjawisko jest sporne. W 2023 roku Rylan Schaeffer, Brando Miranda i Sanmi Koyejo pokazali, że wiele „skoków” znika, gdy zmieni się sposób mierzenia — co sugeruje, że część emergencji to własność metryki, a nie modelu.
Mechanizm — dlaczego tak działa
Argument za realną emergencją: niektóre zadania wymagają złożenia kilku umiejętności naraz (zrozumienie polecenia, wykonanie kilku kroków, sformatowanie odpowiedzi). Dopóki model nie opanuje wszystkich, wynik jest zerowy; gdy opanuje ostatnią — skacze. Dodatkowo wiele zdolności zależy od tego, jak model reaguje na podpowiedzi (np. łańcuch myśli), a ta reakcja sama może pojawić się dopiero powyżej pewnej skali.
Argument przeciw — „miraż metryki”. Wiele zadań ocenia się dokładnym dopasowaniem: odpowiedź jest dobra tylko wtedy, gdy wszystkie jej tokeny są poprawne. Jeśli model poprawia trafność pojedynczego tokenu płynnie i przewidywalnie (tak jak mówią prawa skalowania), to szansa trafienia wszystkich L tokenów naraz wynosi w przybliżeniu p^L. Taka potęga jest płaska przy małym p i stroma przy p bliskim 1. Gładki postęp wygląda wtedy jak nagły skok. Schaeffer i in. pokazali, że po zamianie metryki nieciągłej (dokładne dopasowanie) na ciągłą (np. odległość edycyjną, prawdopodobieństwo poprawnej odpowiedzi) większość krzywych staje się gładka.
Obecny stan wiedzy: oba mechanizmy prawdopodobnie istnieją. Część raportowanych emergencji to artefakt metryki i rzadkiego próbkowania skali (mało modeli pośrednich), część może być realnym efektem złożonych zadań. Praktyczny wniosek nie zależy od rozstrzygnięcia: o tym, czy skok „wygląda na nagły”, decyduje także wybór miary.
Na przykładzie
Prosty rachunek bez danych: załóżmy, że trafność pojedynczego tokenu rośnie płynnie wraz ze skalą modelu, a zadanie wymaga 10 poprawnych tokenów naraz. Przy trafności tokenu 0,5 dokładne dopasowanie wynosi 0,001; przy 0,7 — 0,028; przy 0,8 — 0,107; przy 0,9 — 0,349; przy 0,95 — 0,599; przy 0,99 — 0,904. Dla odpowiedzi 30-tokenowej jest jeszcze ostrzej: 0,042 przy trafności tokenu 0,9 i 0,74 przy 0,99.
Gdyby trafność tokenu rosła liniowo z logarytmem liczby parametrów od 0,60 przy 10 mln do 0,99 przy 100 mld (hipotetyczny, gładki postęp), dokładne dopasowanie dla 10 tokenów wynosiłoby 0,006, 0,027, 0,101, 0,321 i 0,904 dla kolejnych dziesięciokrotności skali. Przez trzy rzędy wielkości „nic się nie dzieje”, a potem następuje „emergencja” — choć w modelu nic nie zmieniło się skokowo.
W praktyce
- Oceniając modele różnej wielkości, raportuj metryki ciągłe (log-prawdopodobieństwo poprawnej odpowiedzi, częściowe dopasowanie) obok dokładnego dopasowania.
- Wykres wyniku w funkcji skali rysuj w skali log-log i z gęstym próbkowaniem — trzy punkty nie wystarczą, by stwierdzić skok.
- Nie zakładaj, że brak umiejętności w małym modelu oznacza brak jej w dużym, ani odwrotnie; testuj na docelowej skali.
- W zadaniach wieloetapowych mierz każdy etap osobno, aby zobaczyć, który element ogranicza wynik.
- Uważaj na kontaminację: „nagła” umiejętność bywa skutkiem tego, że zadanie trafiło do danych treningowych.
Najczęstsze pytania
- Czy zdolności emergentne to dowód, że modele „myślą”?
- Nie. Nawet jeśli skok jest realny, oznacza tylko nieliniową zależność wyniku od skali. Nie mówi nic o świadomości ani o rodzaju wewnętrznych procesów modelu.
- Czy można przewidzieć, kiedy pojawi się nowa umiejętność?
- Jeśli skok jest artefaktem metryki — częściowo tak, śledząc metryki ciągłe na mniejszych modelach. Jeśli jest realnym efektem złożenia umiejętności — przewidywanie jest trudne i to właśnie budzi obawy dotyczące bezpieczeństwa.
- Kto ma rację: Wei czy Schaeffer?
- Spór nie jest rozstrzygnięty. Prace Schaeffera i in. przekonująco pokazały, że wybór metryki może wytworzyć pozorny skok, ale nie dowiodły, że każdy skok jest pozorny.
Źródła
- Wei J. i in. (2022). Emergent Abilities of Large Language Models. Transactions on Machine Learning Research, arXiv:2206.07682.
- Schaeffer R., Miranda B., Koyejo S. (2023). Are Emergent Abilities of Large Language Models a Mirage? NeurIPS 2023, arXiv:2304.15004.
- Srivastava A. i in. (2023). Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models. Transactions on Machine Learning Research.
- Anderson P. W. (1972). More Is Different. Science, 177(4047), 393–396.