Почему большие модели умнее маленьких

Долгие годы у инженеров был эмпирический факт без внятного объяснения. Увеличиваешь модель, и она внезапно начинает справляться с задачами, которые маленькая версия проваливала наглухо. Свежая работа от команды Stanford, Kempner Institute (Harvard), MIT, Anthropic и Goodfire дает на это прямой ответ на уровне процесса обучения.

Объяснение звучит почти контринтуитивно. Большие модели сильнее в редких навыках за счет того, что хуже их забывают по ходу обучения. Лишний объем параметров работает как защита для слабых обучающих сигналов, которые в маленькой сети просто затаптываются более частыми.

Авторы переформулируют сам вопрос. Проблема обычно не в том, способна ли маленькая модель в принципе выразить нужную функцию. Проблема в том, удержит ли обучение этот навык, пока десятки частых задач постоянно давят на одни и те же ограниченные участки сети.

Механика выглядит так. Частые паттерны в данных первыми занимают нейроны и забирают себе вычислительные ресурсы. Редкие задачи встречаются слишком нечасто, чтобы успеть закрепиться, и оказываются перезаписаны до того, как превратятся в устойчивое знание. Маленькая сеть может на мгновение поймать редкий сигнал, но следующая волна обновлений по частым задачам стирает его раньше, чем сигнал появится снова.

Проверяли гипотезу в два этапа. Сначала на контролируемых синтетических задачах, где можно точно крутить редкость и сложность каждой задачи. Потом на реальных языковых моделях OLMo размером от 4 млн до 4 млрд параметров.

Результат оказался устойчивым. Большие модели заметно лучше учили низкочастотные задачи, удерживали больше признаков этих задач внутри своих представлений и показывали меньше интерференции градиентов. Это означает, что обновления по частым задачам меньше мешали обучению редким. У крупной сети хватает места, чтобы удержать слабый редкий сигнал достаточно долго, чтобы он превратился в настоящий навык.

Для практики выводы вполне осязаемые. Выбор размера модели и состав обучающей смеси напрямую влияют на то, какие редкие умения вообще доживут до конца обучения. Если вам нужны хвостовые компетенции, одного увеличения данных может не хватить, если у модели нет запаса емкости под эти сигналы.

Источники: научная работа Why Larger Models Learn More: Effects of Capacity, Interference, and Rare-Task Retention https://arxiv.org/abs/2605.29548 и оригинальный пост в X https://x.com/rohanpaul_ai/status/2063838176884519159

+1
0
+1
0
+1
0
+1
0
+1
0

Ответить

Ваш адрес email не будет опубликован. Обязательные поля помечены *