Dział 09 · 5 haseł
Uczenie ze wzmocnieniem i ewolucja
Agent, nagroda, eksploracja i eksploatacja, algorytmy ewolucyjne: uczenie się z konsekwencji zamiast z etykiet.
- Uczenie ze wzmocnieniem InteraktywneUczenie ze wzmocnieniem to uczenie z nagród za własne działania, bez podanej poprawnej odpowiedzi. Agent zna tylko skutki swoich akcji, więc musi próbować.
- Problem wielorękiego bandyty InteraktywneWieloręki bandyta to dylemat: grać na opcji, która dotąd działała najlepiej, czy sprawdzać inne? Strategie ε-zachłanna, UCB i Thompsona godzą oba cele.
- Q-learning InteraktywneQ-learning uczy agenta, ile warta jest każda akcja w każdym stanie, poprawiając oszacowania po każdym kroku. Znajduje strategię optymalną mimo eksploracji.
- Nagroda a etykieta InteraktywneEtykieta mówi, co należało zrobić, i daje gradient wprost w tę stronę. Nagroda mówi tylko, czy wybrana akcja była dobra — kierunek trzeba odgadnąć z prób.
- Algorytmy ewolucyjneAlgorytm ewolucyjny optymalizuje bez gradientu: ocenia populację, zostawia najlepszych (selekcja), łączy ich geny (krzyżowanie) i losowo je zmienia (mutacja).