ML Atlas

Ścieżka nauki · średni · 14 kroków · ok. 59 min

Modele językowe i transformery

Jak działa czat AI: tokeny, osadzenia, mechanizm uwagi, transformer, przewidywanie następnego tokenu, dostrajanie, RLHF, RAG i skąd biorą się halucynacje.

  1. Duży model językowy (LLM)4 min

    LLM to sieć neuronowa typu transformer trenowana na ogromnym zbiorze tekstu do przewidywania kolejnego tokenu. Z tej prostej zasady biorą się jego umiejętności.

  2. Tokenizacja i BPE5 min

    Tokenizacja dzieli tekst na tokeny, czyli kawałki słów, które model zamienia na liczby. BPE buduje słownik, łącząc najczęstsze pary symboli w dane.

  3. Embeddingi słów4 min

    Embedding słowa to wektor liczb, w którym słowa używane w podobnych kontekstach leżą blisko siebie. To podstawa, na której LLM buduje znaczenie.

  4. Mechanizm uwagi (attention)4 min

    Uwaga pozwala modelowi w każdym kroku sięgnąć do dowolnego fragmentu wejścia i wziąć z niego tyle, ile pasuje do bieżącego pytania — średnią ważoną zgodnością.

  5. Samouwaga (self-attention)5 min

    W samouwadze każdy token tej samej sekwencji tworzy zapytanie, klucz i wartość, a potem zbiera informację od pozostałych tokenów w proporcji do ich zgodności.

  6. Kodowanie pozycyjne5 min

    Samouwaga nie widzi kolejności słów, więc transformer dodaje do każdego tokenu sygnał jego pozycji: sinusoidy, uczone wektory albo obrót zapytań i kluczy.

  7. Transformer4 min

    Transformer to architektura z bloków samouwagi i warstw MLP z połączeniami rezydualnymi. Liczy całą sekwencję naraz i napędza dzisiejsze modele językowe.

  8. Przewidywanie następnego tokenu4 min

    LLM dla każdego miejsca w tekście liczy rozkład prawdopodobieństwa następnego tokenu. Uczy się go entropią krzyżową, a tekst tworzy, losując token po tokenie.

  9. Pretrening modeli językowych4 min

    Pretrening to pierwszy, najdroższy etap tworzenia LLM: model uczy się przewidywać następny token na bilionach tokenów tekstu, zdobywając ogólną wiedzę o języku.

  10. Temperatura i próbkowanie w LLM4 min

    Temperatura dzieli logity przed softmaksem: niska wyostrza rozkład, wysoka go spłaszcza. Top-k i top-p odcinają mało prawdopodobny ogon przed losowaniem.

  11. Dostrajanie modeli (fine-tuning)4 min

    Dostrajanie to dalszy trening gotowego modelu na mniejszym, wyspecjalizowanym zbiorze. Zmienia zachowanie i styl modelu, ale słabo dodaje mu nową wiedzę.

  12. RLHF i DPO — uczenie z preferencji4 min

    RLHF i DPO dostrajają LLM na porównaniach dwóch odpowiedzi ocenionych przez ludzi. Model uczy się odpowiadać tak, jak ludzie wolą, a nie tylko kopiować wzorce.

  13. RAG — generowanie z wyszukiwaniem4 min

    RAG wyszukuje fragmenty dokumentów pasujące do pytania i wkleja je do promptu. Model odpowiada na podstawie źródeł, a nie tylko pamięci z treningu.

  14. Halucynacje modeli językowych4 min

    Halucynacja to płynna, przekonująca, ale fałszywa lub niepoparta treść wygenerowana przez model. Wynika z tego, jak LLM są trenowane i oceniane.

Inne ścieżki

Uczenie maszynowe od zeraJak uczy się sieć neuronowaJak uczciwie ocenić modelDane tabelaryczne i Kaggle