Model Collapse: почему ИИ тупеет от данных, созданных ИИ
Если кажется, что нейросети стали отвечать площе, а тексты в интернете звучат одинаково, этому есть научное объяснение. Исследователи из Оксфорда и Кембриджа описали в Nature эффект Model Collapse.
Суть в одном предложении: когда модель обучают на данных, сгенерированных другой моделью, каждое следующее поколение становится хуже, пока не теряет представление о реальных человеческих данных.
Интернет наполняется машинным контентом, а компании скрапят сеть для обучения новых моделей. Новое поколение ИИ учится на том, что произвело предыдущее, и так по кругу.
Каждый цикл теряет информацию. Первыми исчезают хвосты распределения: редкие и необычные случаи, нетипичные формулировки, неожиданные решения. Остаётся усреднённый центр, и следующая модель учится уже на обеднённой версии.
Главный вывод: деградация наступает быстро, уже за несколько итераций, даже если часть реальных данных остаётся в выборке. Эффект воспроизвели на языковых моделях, на генераторах изображений и на статистических моделях.
Отдельная сложность в том, что машинный текст нельзя надёжно отличить от человеческого, поэтому фильтрация синтетики работает плохо. А потерянные хвосты не восстанавливаются простым добавлением данных позже.
Для разработчиков это значит, что происхождение данных становится критичным параметром. Чистые человеческие датасеты превращаются в дефицитный ресурс, и выиграет тот, кто сохранил их до эпохи массовой генерации.
Источник и обсуждение в X: https://x.com/heynavtoor/status/2064797676475187520
