08 · LLM · 4 min czytania · aktualizacja
Czym są RLHF i DPO i jak uczą LLM odpowiadać tak, jak wolą ludzie?
W skrócie
RLHF i DPO dostrajają LLM na porównaniach dwóch odpowiedzi ocenionych przez ludzi. Model uczy się odpowiadać tak, jak ludzie wolą, a nie tylko kopiować wzorce.
Co to jest
RLHF (reinforcement learning from human feedback, uczenie ze wzmocnieniem na podstawie ludzkich ocen) to metoda dostrajania modelu językowego na danych o preferencjach: ludzie porównują dwie odpowiedzi na to samo polecenie i wskazują lepszą. Z tych porównań uczy się model nagrody, a następnie model językowy jest optymalizowany algorytmem RL (zwykle PPO), by generować odpowiedzi wysoko oceniane. DPO (Direct Preference Optimization, Rafailov i in., 2023) osiąga podobny cel bez osobnego modelu nagrody i bez RL — prostą funkcją straty liczoną bezpośrednio na parach odpowiedzi.
Po co to wszystko, skoro jest dostrajanie na wzorcowych odpowiedziach (SFT)? Bo łatwiej ocenić niż napisać. Człowiek bez trudu stwierdzi, która z dwóch odpowiedzi jest bardziej pomocna, rzetelna i grzeczna, ale napisanie idealnej odpowiedzi na tysiące poleceń jest drogie i trudne. Preferencje przekazują też rzeczy, których nie da się łatwo pokazać przykładem, np. „nie zmyślaj, gdy nie wiesz”.
To właśnie ten etap w dużej mierze odpowiada za różnicę między surowym modelem bazowym a pomocnym asystentem.
Mechanizm — dlaczego tak działa
Klasyczny potok RLHF (Ouyang i in., 2022) ma trzy kroki. (1) SFT: dostrojenie modelu na wzorcowych odpowiedziach. (2) Model nagrody: osobna sieć dostaje polecenie i odpowiedź i zwraca liczbę r. Uczy się jej z porównań według modelu Bradleya–Terry’ego: prawdopodobieństwo, że odpowiedź A jest lepsza od B, wynosi σ(r_A − r_B), gdzie σ to funkcja logistyczna. (3) Optymalizacja RL: model językowy generuje odpowiedzi, model nagrody je ocenia, a PPO zmienia wagi tak, by nagroda rosła.
Kara KL — smycz na modelu. Gdyby maksymalizować samą nagrodę, model szybko znalazłby jej słabości: odpowiedzi przesadnie długie, pochlebcze albo pełne słów, które model nagrody lubi. To przypadek prawa Goodharta. Dlatego do celu dodaje się karę za odejście od modelu referencyjnego (po SFT) mierzone dywergencją Kullbacka–Leiblera, z wagą β. Model ma poprawiać odpowiedzi, ale pozostać blisko sensownego języka.
DPO — ten sam cel, prostsza droga. Rafailov i in. zauważyli, że dla celu „nagroda minus β·KL” optymalna polityka ma postać zamkniętą, z której nagrodę da się wyrazić przez stosunek prawdopodobieństw modelu trenowanego i referencyjnego. Po podstawieniu do modelu Bradleya–Terry’ego dostaje się stratę: −log σ(β·[(log π(y_w) − log π_ref(y_w)) − (log π(y_l) − log π_ref(y_l))]), gdzie y_w to odpowiedź preferowana, a y_l odrzucona. Model podnosi względne prawdopodobieństwo odpowiedzi lepszej i obniża gorszej. Zero próbkowania w trakcie treningu, zero osobnej sieci nagrody — to zwykłe uczenie nadzorowane na parach.
Ograniczenia. Preferencje są zaszumione i zależą od tego, kto ocenia. Oceniający nagradzają odpowiedzi brzmiące pewnie i zgadzające się z nimi, co sprzyja przytakiwaniu (sycophancy) i pewnym siebie halucynacjom. Model nagrody można „oszukać” (reward hacking). Zamiast ludzi coraz częściej oceniają inne modele według spisanych zasad (Bai i in., 2022) — taniej, ale błędy oceniającego przechodzą na ucznia.
Na przykładzie
Model nagrody dał odpowiedzi A wynik 1,5, a odpowiedzi B wynik 0,5. Według modelu Bradleya–Terry’ego prawdopodobieństwo, że człowiek woli A, to σ(1,5 − 0,5) = σ(1) = 0,731. Jeśli człowiek rzeczywiście wybrał A, strata modelu nagrody wynosi −ln 0,731 = 0,313; gdyby wybrał B, wyniosłaby −ln 0,269 = 1,31 i gradient mocno skorygowałby oceny.
Teraz DPO z β = 0,1. Logarytm prawdopodobieństwa odpowiedzi preferowanej wynosi −20 w trenowanym modelu i −22 w referencyjnym (wzrost o 2), a odrzuconej −25 i −24 (spadek o 1). Margines to 0,1 · (2 − (−1)) = 0,3, a strata −ln σ(0,3) = 0,554. Na starcie, gdy oba modele są identyczne, margines wynosi 0, a strata ln 2 = 0,693. Spadek straty oznacza dokładnie to, czego chcemy: model przesunął prawdopodobieństwo z gorszej odpowiedzi na lepszą względem punktu wyjścia. W praktyce efekt tego etapu bywa duży — Ouyang i in. (2022) raportują, że oceniający woleli odpowiedzi InstructGPT z 1,3 mld parametrów od odpowiedzi 175-miliardowego GPT-3.
W praktyce
- Biblioteka
trl:RewardTrainerdla modelu nagrody,PPOTrainerdla RLHF,DPOTrainerdla DPO; dane jako trójki (prompt, chosen, rejected). - DPO jest dziś domyślnym wyborem dla małych zespołów: stabilniejsze i tańsze niż PPO. Typowe β to 0,1–0,5.
- Przed preferencjami zrób SFT — DPO na modelu bazowym działa słabo, bo model referencyjny nie umie jeszcze odpowiadać.
- Pilnuj długości odpowiedzi: wzrost nagrody połączony ze wzrostem długości to częsty objaw reward hackingu.
- Jakość par jest kluczowa: porównania, w których obie odpowiedzi są złe lub prawie identyczne, wnoszą głównie szum.
Najczęstsze pytania
- Czy RLHF to „prawdziwe” uczenie ze wzmocnieniem?
- Tak, w wersji z PPO: model jest polityką, odpowiedź akcją, a ocena modelu nagrody — nagrodą. To jednak RL z bardzo krótkim epizodem (jedna odpowiedź) i z wyuczoną, a nie prawdziwą nagrodą.
- Czym DPO różni się od RLHF?
- Optymalizuje ten sam cel teoretyczny, ale bez osobnego modelu nagrody i bez próbkowania odpowiedzi w trakcie treningu. Jest prostsze i stabilniejsze; RLHF z PPO bywa lepsze, gdy można generować nowe odpowiedzi i oceniać je na bieżąco.
- Czy uczenie z preferencji czyni model prawdomównym?
- Tylko o tyle, o ile oceniający nagradzają prawdę i potrafią ją rozpoznać. Gdy wolą odpowiedzi pewne i przyjemne, model uczy się brzmieć pewnie, a niekoniecznie mieć rację.
Źródła
- Christiano P. i in., 2017, „Deep Reinforcement Learning from Human Preferences”, NeurIPS 2017.
- Ouyang L. i in., 2022, „Training language models to follow instructions with human feedback”, NeurIPS 2022.
- Rafailov R. i in., 2023, „Direct Preference Optimization: Your Language Model is Secretly a Reward Model”, NeurIPS 2023.
- Schulman J. i in., 2017, „Proximal Policy Optimization Algorithms”, arXiv:1707.06347.
- Bai Y. i in., 2022, „Constitutional AI: Harmlessness from AI Feedback”, arXiv:2212.08073.