Ścieżka nauki · średni · 14 kroków · ok. 59 min
Modele językowe i transformery
Jak działa czat AI: tokeny, osadzenia, mechanizm uwagi, transformer, przewidywanie następnego tokenu, dostrajanie, RLHF, RAG i skąd biorą się halucynacje.
- Duży model językowy (LLM)4 min
LLM to sieć neuronowa typu transformer trenowana na ogromnym zbiorze tekstu do przewidywania kolejnego tokenu. Z tej prostej zasady biorą się jego umiejętności.
- Tokenizacja i BPE5 min
Tokenizacja dzieli tekst na tokeny, czyli kawałki słów, które model zamienia na liczby. BPE buduje słownik, łącząc najczęstsze pary symboli w dane.
- Embeddingi słów4 min
Embedding słowa to wektor liczb, w którym słowa używane w podobnych kontekstach leżą blisko siebie. To podstawa, na której LLM buduje znaczenie.
- Mechanizm uwagi (attention)4 min
Uwaga pozwala modelowi w każdym kroku sięgnąć do dowolnego fragmentu wejścia i wziąć z niego tyle, ile pasuje do bieżącego pytania — średnią ważoną zgodnością.
- Samouwaga (self-attention)5 min
W samouwadze każdy token tej samej sekwencji tworzy zapytanie, klucz i wartość, a potem zbiera informację od pozostałych tokenów w proporcji do ich zgodności.
- Kodowanie pozycyjne5 min
Samouwaga nie widzi kolejności słów, więc transformer dodaje do każdego tokenu sygnał jego pozycji: sinusoidy, uczone wektory albo obrót zapytań i kluczy.
- Transformer4 min
Transformer to architektura z bloków samouwagi i warstw MLP z połączeniami rezydualnymi. Liczy całą sekwencję naraz i napędza dzisiejsze modele językowe.
- Przewidywanie następnego tokenu4 min
LLM dla każdego miejsca w tekście liczy rozkład prawdopodobieństwa następnego tokenu. Uczy się go entropią krzyżową, a tekst tworzy, losując token po tokenie.
- Pretrening modeli językowych4 min
Pretrening to pierwszy, najdroższy etap tworzenia LLM: model uczy się przewidywać następny token na bilionach tokenów tekstu, zdobywając ogólną wiedzę o języku.
- Temperatura i próbkowanie w LLM4 min
Temperatura dzieli logity przed softmaksem: niska wyostrza rozkład, wysoka go spłaszcza. Top-k i top-p odcinają mało prawdopodobny ogon przed losowaniem.
- Dostrajanie modeli (fine-tuning)4 min
Dostrajanie to dalszy trening gotowego modelu na mniejszym, wyspecjalizowanym zbiorze. Zmienia zachowanie i styl modelu, ale słabo dodaje mu nową wiedzę.
- RLHF i DPO — uczenie z preferencji4 min
RLHF i DPO dostrajają LLM na porównaniach dwóch odpowiedzi ocenionych przez ludzi. Model uczy się odpowiadać tak, jak ludzie wolą, a nie tylko kopiować wzorce.
- RAG — generowanie z wyszukiwaniem4 min
RAG wyszukuje fragmenty dokumentów pasujące do pytania i wkleja je do promptu. Model odpowiada na podstawie źródeł, a nie tylko pamięci z treningu.
- Halucynacje modeli językowych4 min
Halucynacja to płynna, przekonująca, ale fałszywa lub niepoparta treść wygenerowana przez model. Wynika z tego, jak LLM są trenowane i oceniane.