11 · Prawa i prawdy · 3 min czytania · aktualizacja
Co to jest paradoks Moraveca i dlaczego dla AI łatwe rzeczy są trudne?
W skrócie
To, co ludziom przychodzi bez wysiłku — widzenie, chodzenie, chwytanie — okazuje się dla maszyn najtrudniejsze, a to, co trudne dla ludzi, bywa dla nich łatwe.
Co to jest
Wysokopoziomowe rozumowanie wymaga od komputera niewielu obliczeń, a niskopoziomowe umiejętności sensoryczne i ruchowe — ogromnych. Obserwację opisał robotyk Hans Moravec w książce „Mind Children” z 1988 roku; podobne myśli formułowali w tym czasie Marvin Minsky i Rodney Brooks.
W skrócie: stosunkowo łatwo zbudować program, który gra w szachy na poziomie mistrza, rozwiązuje całki albo zdaje test inteligencji, a bardzo trudno — taki, który ma percepcję i zręczność rocznego dziecka. Komputer mnoży miliony liczb w ułamku sekundy, ale długo nie potrafił odróżnić kota od psa na zdjęciu ani złożyć ręcznika.
Steven Pinker podsumował to w 1994 roku zdaniem, że główną lekcją trzydziestu pięciu lat badań nad AI jest to, iż trudne problemy są łatwe, a łatwe — trudne.
Mechanizm — dlaczego tak działa
Wyjaśnienie Moraveca jest ewolucyjne. Percepcja i motoryka to umiejętności doskonalone przez setki milionów lat; mózg poświęca im ogromne zasoby, a my nie mamy do nich świadomego dostępu — dlatego wydają się „łatwe”. Abstrakcyjne myślenie, matematyka czy logika są ewolucyjnie świeże. Wykonujemy je powoli i z wysiłkiem, więc wydają się „trudne”, choć obliczeniowo są proste: kilka reguł i jasno określony stan.
Drugie wyjaśnienie jest informacyjne. Szachy mają kompletne, dyskretne reguły i pełną informację o stanie. Świat fizyczny jest ciągły, zaszumiony, częściowo obserwowalny i pełen wyjątków. Rozpoznanie przedmiotu wymaga odporności na oświetlenie, perspektywę, zasłonięcia i przesunięcia — niezmienniczości, której nie da się łatwo spisać w regułach. Trzeba się jej nauczyć z ogromnej liczby przykładów.
Status po rewolucji uczenia głębokiego jest mieszany. Sieci konwolucyjne rozwiązały znaczną część problemu widzenia (rozpoznawanie obrazów, od mniej więcej 2012 roku), a duże modele językowe — wiele zadań językowych. Ale robotyka manipulacyjna, chodzenie w nieuporządkowanym terenie i elastyczna zręczność dłoni wciąż pozostają wyraźnie trudniejsze niż gra w szachy czy pisanie kodu. Paradoks nie jest prawem, tylko trafną obserwacją o rozkładzie trudności, który okazał się trwały.
Na przykładzie
Dwie liczby z jednego komputera. Dziesięć milionów mnożeń liczb zmiennoprzecinkowych w numpy zajęło 0,014 sekundy — zadanie, które człowiekowi zajęłoby lata. A teraz coś, co człowiek robi bez myślenia: rozpoznawanie cyfr. SVM wytrenowany na 1257 obrazach Digits 8×8 rozpoznaje cyfry testowe z dokładnością 0,987.
Wystarczy jednak przesunąć każdy obraz testowy o jeden piksel w lewo, prawo, górę lub dół — zmiana, której człowiek nawet by nie zauważył przy rozpoznawaniu — i dokładność spada średnio do 0,53. Przesunięcie o dwa piksele: 0,12, czyli prawie poziom zgadywania (0,10). Jeden piksel to tu wprawdzie 12,5% szerokości obrazu, ale cyfra pozostaje doskonale czytelna. Niezmienniczość względem przesunięć, którą ludzki wzrok ma „za darmo”, model musi dostać w architekturze (konwolucje) albo wyuczyć się jej z danych (augmentacja).
Dane: Digits (ręcznie pisane cyfry 8×8)
W praktyce
- Zanim uznasz problem percepcyjny za łatwy, sprawdź, ile wariantów (oświetlenie, kąt, przesunięcie, tło) musi obsłużyć model.
- Niezmienniczość wbudowuj architekturą (
nn.Conv2d, pooling) lub augmentacją (torchvision.transforms.RandomAffine,RandomResizedCrop). - Testuj odporność: małe przesunięcia, szum, zmiana jasności — dokładność na czystym zbiorze testowym tego nie mierzy.
- W robotyce symulacja (sim-to-real) i losowa zmienność środowiska (domain randomization) to standardowe sposoby zdobycia danych, których w świecie fizycznym jest mało.
- Zadania z jasnymi regułami i pełną informacją (planowanie, gry, optymalizacja) są często dobrym kandydatem do automatyzacji nawet bez dużych danych.
Najczęstsze pytania
- Czy uczenie głębokie rozwiązało paradoks Moraveca?
- Częściowo. Rozpoznawanie obrazów i mowy jest dziś wykonywane na poziomie zbliżonym do ludzkiego w wielu zadaniach. Zręczna manipulacja przedmiotami i ruch w nieznanym otoczeniu wciąż pozostają trudne.
- Dlaczego duże modele językowe dobrze piszą, a roboty słabo składają pranie?
- Bo tekstów są biliony tokenów w internecie, a danych o fizycznej manipulacji — znikomo mało. Do tego świat fizyczny karze błędy natychmiast i nie da się go łatwo zasymulować z pełną wiernością.
- Czy paradoks dotyczy też ludzi uczących się?
- Do pewnego stopnia: to, co opanowaliśmy w dzieciństwie, wydaje się nam oczywiste i trudno to wytłumaczyć. Dlatego eksperci często nie potrafią spisać reguł własnych umiejętności — co jest jednym z powodów, dla których systemy regułowe zawodziły.
Źródła
- Moravec H. (1988). Mind Children: The Future of Robot and Human Intelligence. Harvard University Press.
- Brooks R. A. (1990). Elephants Don’t Play Chess. Robotics and Autonomous Systems, 6(1–2), 3–15.
- Minsky M. (1986). The Society of Mind. Simon & Schuster.
- Pinker S. (1994). The Language Instinct. William Morrow.