Dział 08 · 20 haseł
Modele językowe (LLM)
Tokenizacja, przewidywanie następnego tokenu, pretrening, fine-tuning, RLHF, temperatura, RAG i halucynacje.
- Duży model językowy (LLM) InteraktywneLLM to sieć neuronowa typu transformer trenowana na ogromnym zbiorze tekstu do przewidywania kolejnego tokenu. Z tej prostej zasady biorą się jego umiejętności.
- Tokenizacja i BPE InteraktywneTokenizacja dzieli tekst na tokeny, czyli kawałki słów, które model zamienia na liczby. BPE buduje słownik, łącząc najczęstsze pary symboli w dane.
- Embeddingi słów InteraktywneEmbedding słowa to wektor liczb, w którym słowa używane w podobnych kontekstach leżą blisko siebie. To podstawa, na której LLM buduje znaczenie.
- Przewidywanie następnego tokenu InteraktywneLLM dla każdego miejsca w tekście liczy rozkład prawdopodobieństwa następnego tokenu. Uczy się go entropią krzyżową, a tekst tworzy, losując token po tokenie.
- Okno kontekstuOkno kontekstu to maksymalna liczba tokenów, które model widzi naraz: polecenie, historia rozmowy, dokumenty i jego odpowiedź. Poza nim model nic nie pamięta.
- Temperatura i próbkowanie w LLM InteraktywneTemperatura dzieli logity przed softmaksem: niska wyostrza rozkład, wysoka go spłaszcza. Top-k i top-p odcinają mało prawdopodobny ogon przed losowaniem.
- Pretrening modeli językowychPretrening to pierwszy, najdroższy etap tworzenia LLM: model uczy się przewidywać następny token na bilionach tokenów tekstu, zdobywając ogólną wiedzę o języku.
- Dostrajanie modeli (fine-tuning)Dostrajanie to dalszy trening gotowego modelu na mniejszym, wyspecjalizowanym zbiorze. Zmienia zachowanie i styl modelu, ale słabo dodaje mu nową wiedzę.
- LoRA i dostrajanie parametrooszczędneLoRA zamraża wagi modelu i uczy małej poprawki: iloczynu dwóch wąskich macierzy. Trenuje ułamek procenta parametrów, a działa prawie jak pełne dostrajanie.
- RLHF i DPO — uczenie z preferencjiRLHF i DPO dostrajają LLM na porównaniach dwóch odpowiedzi ocenionych przez ludzi. Model uczy się odpowiadać tak, jak ludzie wolą, a nie tylko kopiować wzorce.
- Prompting — jak pisać poleceniaPrompt to tekst wejściowy, który warunkuje odpowiedź modelu. Dobre polecenie podaje cel, kontekst, format i przykłady, bo model widzi tylko to, co mu napiszesz.
- Uczenie w kontekście (few-shot)Uczenie w kontekście to zdolność LLM do wykonania nowego zadania na podstawie kilku przykładów w prompcie, bez zmiany wag. Pojawia się wraz ze skalą modelu.
- Łańcuch myśli (chain-of-thought)Łańcuch myśli to rozpisanie kroków pośrednich przed odpowiedzią. Daje modelowi więcej obliczeń i poprawia wyniki w zadaniach wieloetapowych.
- RAG — generowanie z wyszukiwaniem InteraktywneRAG wyszukuje fragmenty dokumentów pasujące do pytania i wkleja je do promptu. Model odpowiada na podstawie źródeł, a nie tylko pamięci z treningu.
- Wyszukiwanie wektorowe InteraktywneWyszukiwanie wektorowe znajduje wektory najbliższe zapytaniu. Przy milionach wpisów używa indeksów przybliżonych, które oddają trochę trafności za szybkość.
- Fine-tuning, RAG czy promptingZacznij od dobrego promptu. Gdy modelowi brakuje wiedzy, dodaj RAG. Fine-tuning zostaw na zmianę zachowania: formatu, stylu, specjalizacji, mniejszego modelu.
- Agenci AI i używanie narzędziAgent AI to LLM działający w pętli: planuje, wywołuje narzędzia jak wyszukiwarka czy kod, czyta wyniki i decyduje, co dalej. Błędy kumulują się z krokami.
- Halucynacje modeli językowych InteraktywneHalucynacja to płynna, przekonująca, ale fałszywa lub niepoparta treść wygenerowana przez model. Wynika z tego, jak LLM są trenowane i oceniane.
- Ewaluacja modeli językowychLLM ocenia się benchmarkami z kluczem odpowiedzi, testami kodu, porównaniami przez ludzi i oceną przez inny model. Każda metoda ma błąd statystyczny i luki.
- Kwantyzacja i destylacja modeliKwantyzacja zapisuje wagi mniejszą liczbą bitów, a destylacja uczy mały model naśladować duży. Obie zmniejszają koszt przy niewielkiej utracie jakości.