ML Atlas

11 · Prawa i prawdy · 3 min czytania · aktualizacja

Co to jest paradoks Moraveca i dlaczego dla AI łatwe rzeczy są trudne?

W skrócie

To, co ludziom przychodzi bez wysiłku — widzenie, chodzenie, chwytanie — okazuje się dla maszyn najtrudniejsze, a to, co trudne dla ludzi, bywa dla nich łatwe.

Co to jest

Wysokopoziomowe rozumowanie wymaga od komputera niewielu obliczeń, a niskopoziomowe umiejętności sensoryczne i ruchowe — ogromnych. Obserwację opisał robotyk Hans Moravec w książce „Mind Children” z 1988 roku; podobne myśli formułowali w tym czasie Marvin Minsky i Rodney Brooks.

W skrócie: stosunkowo łatwo zbudować program, który gra w szachy na poziomie mistrza, rozwiązuje całki albo zdaje test inteligencji, a bardzo trudno — taki, który ma percepcję i zręczność rocznego dziecka. Komputer mnoży miliony liczb w ułamku sekundy, ale długo nie potrafił odróżnić kota od psa na zdjęciu ani złożyć ręcznika.

Steven Pinker podsumował to w 1994 roku zdaniem, że główną lekcją trzydziestu pięciu lat badań nad AI jest to, iż trudne problemy są łatwe, a łatwe — trudne.

Mechanizm — dlaczego tak działa

Wyjaśnienie Moraveca jest ewolucyjne. Percepcja i motoryka to umiejętności doskonalone przez setki milionów lat; mózg poświęca im ogromne zasoby, a my nie mamy do nich świadomego dostępu — dlatego wydają się „łatwe”. Abstrakcyjne myślenie, matematyka czy logika są ewolucyjnie świeże. Wykonujemy je powoli i z wysiłkiem, więc wydają się „trudne”, choć obliczeniowo są proste: kilka reguł i jasno określony stan.

Drugie wyjaśnienie jest informacyjne. Szachy mają kompletne, dyskretne reguły i pełną informację o stanie. Świat fizyczny jest ciągły, zaszumiony, częściowo obserwowalny i pełen wyjątków. Rozpoznanie przedmiotu wymaga odporności na oświetlenie, perspektywę, zasłonięcia i przesunięcia — niezmienniczości, której nie da się łatwo spisać w regułach. Trzeba się jej nauczyć z ogromnej liczby przykładów.

Status po rewolucji uczenia głębokiego jest mieszany. Sieci konwolucyjne rozwiązały znaczną część problemu widzenia (rozpoznawanie obrazów, od mniej więcej 2012 roku), a duże modele językowe — wiele zadań językowych. Ale robotyka manipulacyjna, chodzenie w nieuporządkowanym terenie i elastyczna zręczność dłoni wciąż pozostają wyraźnie trudniejsze niż gra w szachy czy pisanie kodu. Paradoks nie jest prawem, tylko trafną obserwacją o rozkładzie trudności, który okazał się trwały.

Na przykładzie

Dwie liczby z jednego komputera. Dziesięć milionów mnożeń liczb zmiennoprzecinkowych w numpy zajęło 0,014 sekundy — zadanie, które człowiekowi zajęłoby lata. A teraz coś, co człowiek robi bez myślenia: rozpoznawanie cyfr. SVM wytrenowany na 1257 obrazach Digits 8×8 rozpoznaje cyfry testowe z dokładnością 0,987.

Wystarczy jednak przesunąć każdy obraz testowy o jeden piksel w lewo, prawo, górę lub dół — zmiana, której człowiek nawet by nie zauważył przy rozpoznawaniu — i dokładność spada średnio do 0,53. Przesunięcie o dwa piksele: 0,12, czyli prawie poziom zgadywania (0,10). Jeden piksel to tu wprawdzie 12,5% szerokości obrazu, ale cyfra pozostaje doskonale czytelna. Niezmienniczość względem przesunięć, którą ludzki wzrok ma „za darmo”, model musi dostać w architekturze (konwolucje) albo wyuczyć się jej z danych (augmentacja).

Dane: Digits (ręcznie pisane cyfry 8×8)

W praktyce

  • Zanim uznasz problem percepcyjny za łatwy, sprawdź, ile wariantów (oświetlenie, kąt, przesunięcie, tło) musi obsłużyć model.
  • Niezmienniczość wbudowuj architekturą (nn.Conv2d, pooling) lub augmentacją (torchvision.transforms.RandomAffine, RandomResizedCrop).
  • Testuj odporność: małe przesunięcia, szum, zmiana jasności — dokładność na czystym zbiorze testowym tego nie mierzy.
  • W robotyce symulacja (sim-to-real) i losowa zmienność środowiska (domain randomization) to standardowe sposoby zdobycia danych, których w świecie fizycznym jest mało.
  • Zadania z jasnymi regułami i pełną informacją (planowanie, gry, optymalizacja) są często dobrym kandydatem do automatyzacji nawet bez dużych danych.

Najczęstsze pytania

Czy uczenie głębokie rozwiązało paradoks Moraveca?
Częściowo. Rozpoznawanie obrazów i mowy jest dziś wykonywane na poziomie zbliżonym do ludzkiego w wielu zadaniach. Zręczna manipulacja przedmiotami i ruch w nieznanym otoczeniu wciąż pozostają trudne.
Dlaczego duże modele językowe dobrze piszą, a roboty słabo składają pranie?
Bo tekstów są biliony tokenów w internecie, a danych o fizycznej manipulacji — znikomo mało. Do tego świat fizyczny karze błędy natychmiast i nie da się go łatwo zasymulować z pełną wiernością.
Czy paradoks dotyczy też ludzi uczących się?
Do pewnego stopnia: to, co opanowaliśmy w dzieciństwie, wydaje się nam oczywiste i trudno to wytłumaczyć. Dlatego eksperci często nie potrafią spisać reguł własnych umiejętności — co jest jednym z powodów, dla których systemy regułowe zawodziły.

Źródła

  • Moravec H. (1988). Mind Children: The Future of Robot and Human Intelligence. Harvard University Press.
  • Brooks R. A. (1990). Elephants Don’t Play Chess. Robotics and Autonomous Systems, 6(1–2), 3–15.
  • Minsky M. (1986). The Society of Mind. Simon & Schuster.
  • Pinker S. (1994). The Language Instinct. William Morrow.

Zobacz też