11 · Prawa i prawdy · 3 min czytania · aktualizacja
Czym jest model collapse i co się dzieje, gdy AI uczy się na danych z AI?
W skrócie
Model trenowany kolejno na danych wygenerowanych przez poprzednie modele traci rzadkie przypadki i różnorodność, aż jego rozkład zapada się do wąskiego wycinka.
Co to jest
Gdy kolejne pokolenia modeli generatywnych uczą się na danych wytworzonych przez poprzednie pokolenia, ich rozkład stopniowo traci ogony — rzadkie, nietypowe przypadki — i zbiega do zubożonej, coraz węższej wersji oryginału. Zjawisko opisali Ilia Shumailov i współautorzy; najszerzej cytowana wersja ukazała się w Nature w 2024 roku.
Analogia: kserokopia kserokopii. Każda kopia jest prawie wierna, ale drobne zniekształcenia się kumulują, a szczegóły z brzegów kartki znikają jako pierwsze. Po kilkudziesięciu pokoleniach z tekstu zostaje mazanie.
Problem jest praktyczny, bo internet — główne źródło danych do trenowania modeli językowych i obrazowych — coraz bardziej wypełnia się treściami wygenerowanymi przez modele. Kolejne pokolenia mogą nieświadomie uczyć się na własnym „echu”.
Mechanizm — dlaczego tak działa
Są dwa źródła błędu, które kumulują się z pokolenia na pokolenie. Pierwsze to błąd próbkowania: model widzi skończoną próbkę, a rzadkie zdarzenia z dużym prawdopodobieństwem w niej nie wystąpią. Czego nie było w próbce, tego następny model nie nauczy się generować — a skoro nie generuje, nie trafi to do próbki kolejnego. Utrata jest nieodwracalna.
Drugie to błąd aproksymacji: model nie odtwarza rozkładu idealnie. Ma ograniczoną pojemność i preferuje typowe przypadki (np. przy próbkowaniu z niską temperaturą). Każde pokolenie lekko zawęża rozkład i przesuwa go w stronę „średniej”.
W najprostszym przypadku — dopasowujemy rozkład normalny, losujemy z niego, dopasowujemy znowu — oszacowanie odchylenia standardowego jest średnio lekko zaniżone, a średnia błądzi losowo. Te małe błędy się mnożą: wariancja maleje z pokolenia na pokolenie, aż rozkład zapada się prawie do punktu. Shumailov i in. pokazali to samo dla mieszanin gaussowskich, autoenkoderów wariacyjnych i modeli językowych: najpierw znikają ogony, potem treść staje się powtarzalna i oderwana od oryginału.
Zastrzeżenia: zapaść jest najsilniejsza w scenariuszu, w którym każde pokolenie zastępuje dane poprzednie danymi syntetycznymi. Gerstgrasser i in. (2024) pokazali, że gdy dane syntetyczne są dokładane do zachowanych danych prawdziwych, błąd pozostaje ograniczony. Rzeczywisty internet to coś pośredniego, więc skala zagrożenia w praktyce jest przedmiotem dyskusji.
Na przykładzie
Symulacja: zaczynamy od rozkładu normalnego N(0, 1). W każdym pokoleniu losujemy n próbek z bieżącego modelu, dopasowujemy nowy rozkład normalny (średnia i odchylenie z próbki) i powtarzamy. Mediana z 5000 niezależnych łańcuchów.
Przy n = 100 próbek na pokolenie mediana odchylenia standardowego wynosi 0,99 po 1 pokoleniu, 0,90 po 10, 0,59 po 50, 0,36 po 100 i 0,13 po 200. Przy n = 10 zapaść jest błyskawiczna: 0,34 po 10 pokoleniach, 0,004 po 50. Odchylenie 0,6 oznacza, że wartości oddalone od zera o więcej niż 2 (w oryginale 4,6% przypadków) model generuje z prawdopodobieństwem 0,09% — ogony praktycznie zniknęły.
Środki zaradcze działają: gdy w każdym pokoleniu 20% próbki pochodzi z oryginalnego rozkładu, mediana odchylenia po 200 pokoleniach wynosi 0,97. Gdy dane są kumulowane (każdy model uczy się na wszystkich dotychczasowych danych, w tym oryginalnych) — 0,99.
W praktyce
- Zachowuj i wersjonuj oryginalne, ludzkie dane; mieszaj je z syntetycznymi zamiast je zastępować.
- Oznaczaj pochodzenie danych (provenance), aby móc odfiltrować treści wygenerowane przez modele.
- Monitoruj różnorodność wyjść: rozkład długości, słownictwo, częstość rzadkich kategorii — spadek to wczesny sygnał zapaści.
- Dane syntetyczne do augmentacji są użyteczne, gdy są weryfikowane (np. testy dla kodu, sprawdzenie rozwiązań w matematyce).
- Próbkowanie z niską temperaturą przy generowaniu danych treningowych przyspiesza utratę ogonów.
Najczęstsze pytania
- Czy dane syntetyczne są zawsze szkodliwe?
- Nie. Dane syntetyczne z weryfikacją jakości, dodawane do danych prawdziwych, często pomagają (np. w destylacji czy augmentacji). Szkodliwa jest rekurencyjna pętla bez dopływu prawdziwych danych.
- Czy zapaść modelu już się dzieje w praktyce?
- Nie ma jednoznacznych dowodów na zapaść dużych modeli komercyjnych. Udział treści generowanych w sieci rośnie, więc firmy coraz staranniej filtrują i datują dane, by zapobiec temu zjawisku.
- Czym różni się to od zapaści trybów (mode collapse) w GAN-ach?
- Mode collapse to problem jednego treningu: generator GAN produkuje tylko kilka typów przykładów. Zapaść modelu to proces międzypokoleniowy, wynikający z uczenia na danych wygenerowanych przez poprzednie modele.
Źródła
- Shumailov I., Shumaylov Z., Zhao Y., Papernot N., Anderson R., Gal Y. (2024). AI Models Collapse When Trained on Recursively Generated Data. Nature, 631, 755–759.
- Alemohammad S. i in. (2024). Self-Consuming Generative Models Go MAD. ICLR 2024.
- Gerstgrasser M. i in. (2024). Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic Data. arXiv:2404.01413.
- Bishop C. M. (2006). Pattern Recognition and Machine Learning. Springer, rozdz. 2.3.