11 · Prawa i prawdy · 4 min czytania · aktualizacja
Czym jest gorzka lekcja Richarda Suttona i czy wiedza ekspercka w AI przegrywa z obliczeniami?
W skrócie
W historii AI ogólne metody skalujące się z obliczeniami wygrywały z ręcznie wbudowaną wiedzą ludzką. To interpretacja historii, nie twierdzenie, i ma krytyków.
Co to jest
W długim okresie w sztucznej inteligencji wygrywają ogólne metody, które potrafią wykorzystać rosnącą moc obliczeniową — przede wszystkim przeszukiwanie i uczenie — a nie metody oparte na wbudowanej ludzkiej wiedzy o problemie. Tezę sformułował Richard Sutton, jeden z twórców uczenia ze wzmocnieniem, w krótkim eseju „The Bitter Lesson” z 2019 roku.
„Gorzka”, bo badacze wielokrotnie inwestowali lata w kodowanie własnej wiedzy — reguł szachowych, fonetyki, krawędzi w obrazach — i za każdym razem w końcu przegrywali z prostszymi, bardziej ogólnymi metodami, które po prostu dostały więcej obliczeń i danych. Sutton przywołuje szachy (przeszukiwanie Deep Blue), go (samodzielna gra AlphaGo), rozpoznawanie mowy (modele statystyczne zamiast reguł językoznawczych) i widzenie komputerowe (sieci konwolucyjne zamiast ręcznych cech).
To ważne zastrzeżenie od początku: to nie twierdzenie matematyczne ani prawo empiryczne z pomiarami, tylko interpretacja historii dziedziny. Jest wpływowa, ale też krytykowana.
Mechanizm — dlaczego tak działa
Argument Suttona opiera się na prawie Moore’a w szerokim sensie: koszt obliczeń spadał wykładniczo przez dziesięciolecia. Metoda, której jakość rośnie z obliczeniami, staje się co kilka lat dramatycznie lepsza bez dodatkowej pracy ludzi. Metoda oparta na ręcznej wiedzy poprawia się tylko wtedy, gdy ludzie wymyślą coś nowego — liniowo, a nie wykładniczo.
Drugi argument dotyczy sufitu. Wbudowana wiedza to założenia, a założenia ograniczają. Ręcznie zaprojektowane cechy obrazu odrzucają informację, którą projektant uznał za nieistotną; model uczący się z pikseli może ją wykorzystać, jeśli dostanie dość danych. Na krótką metę wiedza pomaga (mniej danych, szybszy wynik), na długą — staje się sufitem.
Trzeci argument jest psychologiczny: wbudowywanie własnej wiedzy jest satysfakcjonujące i daje szybkie wyniki w publikacjach, więc badacze systematycznie przeceniają jego wartość.
Krytyka jest poważna. Rodney Brooks w odpowiedzi „A Better Lesson” (2019) zauważył, że sukcesy uczenia głębokiego same opierają się na ludzkiej wiedzy wbudowanej w architekturę — konwolucja zakłada niezmienniczość względem przesunięć, a transformery i ich mechanizm uwagi też są decyzjami projektowymi. Do tego koszty energii i danych rosną, a w wielu zastosowaniach (mała liczba danych, wymagania bezpieczeństwa, interpretowalność) wiedza dziedzinowa pozostaje kluczowa. Zgodnie z zasadą „nie ma darmowego lunchu” jakieś założenia są zawsze potrzebne — spór dotyczy tego, jak ogólne powinny być.
Na przykładzie
Mała ilustracja na Digits 8×8 (średnia z 10 losowań, test na 500 obrazach) — nie dowód, tylko pokazanie kształtu argumentu. „Wiedza”: 32 ręcznie zaprojektowane cechy (obraz uśredniony do 4×4 plus sumy wierszy i kolumn) z SVM. „Metoda ogólna”: sieć MLP z warstwą 256 neuronów na surowych 64 pikselach.
Przy 20 przykładach treningowych obie są podobne: błąd 35,7% dla cech ręcznych, 33,7% dla sieci. Przy 200 przykładach: 13,9% wobec 8,1%. Przy 1200: 6,2% wobec 2,0%. Ręczne cechy poprawiają się wolniej, bo ich projektant wyrzucił część informacji, a sieć korzysta z niej tym lepiej, im więcej ma danych. Uczciwie: SVM na surowych pikselach był tu najlepszy przy każdej wielkości zbioru, a w tak małym problemie przewaga „ogólności” wynika głównie z utraty informacji w kompresji, nie ze skali obliczeń.
Dane: Digits (ręcznie pisane cyfry 8×8)
W praktyce
- Zanim zbudujesz skomplikowane cechy, sprawdź mocny ogólny model na surowych danych (
HistGradientBoostingClassifier, prosty CNN, gotowy model pretrenowany). - Przy małej liczbie danych wiedza dziedzinowa (cechy, ograniczenia monotoniczności, augmentacja) zwykle wygrywa — gorzka lekcja dotyczy długiego okresu i dużej skali.
- Inwestuj w to, co się skaluje: potok danych, automatyzację eksperymentów, możliwość trenowania dłużej i na większych zbiorach.
- Transfer learning to kompromis: ogólna metoda wytrenowana dużym kosztem przez kogoś innego, dostrojona do Twojego problemu.
- Rób krzywe uczenia dla obu podejść; przecięcie krzywych pokazuje, od ilu danych wiedza przestaje się opłacać.
Najczęstsze pytania
- Czy gorzka lekcja znaczy, że inżynieria cech jest bezużyteczna?
- Nie. W danych tabelarycznych, przy małych zbiorach i ograniczonym budżecie dobre cechy często dają największy zysk. Teza Suttona dotyczy długoterminowych trendów w problemach, gdzie dane i obliczenia mogą rosnąć bez końca.
- Czy prawa skalowania potwierdzają gorzką lekcję?
- Są z nią zgodne: przewidywalny spadek straty z rosnącymi obliczeniami to dokładnie ten mechanizm, o którym pisał Sutton. Nie rozstrzygają jednak, czy skalowanie wystarczy do wszystkich celów.
- Kto się z tą tezą nie zgadza?
- Krytycy wskazują, że udane architektury same zawierają ludzką wiedzę, że koszty skalowania rosną, a niektóre problemy (rozumowanie, mała ilość danych) wciąż wymagają odpowiednich założeń. Spór jest otwarty.
Źródła
- Sutton R. (2019). The Bitter Lesson. Esej, http://www.incompleteideas.net/IncIdeas/BitterLesson.html
- Brooks R. (2019). A Better Lesson. Blog, https://rodneybrooks.com/a-better-lesson/
- Silver D. i in. (2017). Mastering the Game of Go without Human Knowledge. Nature, 550, 354–359.
- Krizhevsky A., Sutskever I., Hinton G. E. (2012). ImageNet Classification with Deep Convolutional Neural Networks. NeurIPS 2012.
- Campbell M., Hoane A. J., Hsu F. (2002). Deep Blue. Artificial Intelligence, 134(1–2), 57–83.