Model Collapse: почему ИИ тупеет от данных, созданных ИИ

Если кажется, что нейросети стали отвечать площе, а тексты в интернете звучат одинаково, этому есть научное объяснение. Исследователи из Оксфорда и Кембриджа описали в Nature эффект Model Collapse.

Суть в одном предложении: когда модель обучают на данных, сгенерированных другой моделью, каждое следующее поколение становится хуже, пока не теряет представление о реальных человеческих данных.

Интернет наполняется машинным контентом, а компании скрапят сеть для обучения новых моделей. Новое поколение ИИ учится на том, что произвело предыдущее, и так по кругу.

Каждый цикл теряет информацию. Первыми исчезают хвосты распределения: редкие и необычные случаи, нетипичные формулировки, неожиданные решения. Остаётся усреднённый центр, и следующая модель учится уже на обеднённой версии.

Главный вывод: деградация наступает быстро, уже за несколько итераций, даже если часть реальных данных остаётся в выборке. Эффект воспроизвели на языковых моделях, на генераторах изображений и на статистических моделях.

Отдельная сложность в том, что машинный текст нельзя надёжно отличить от человеческого, поэтому фильтрация синтетики работает плохо. А потерянные хвосты не восстанавливаются простым добавлением данных позже.

Для разработчиков это значит, что происхождение данных становится критичным параметром. Чистые человеческие датасеты превращаются в дефицитный ресурс, и выиграет тот, кто сохранил их до эпохи массовой генерации.

Источник и обсуждение в X: https://x.com/heynavtoor/status/2064797676475187520

+1
0
+1
0
+1
0
+1
0
+1
0

Ответить

Ваш адрес email не будет опубликован. Обязательные поля помечены *