Карпаты показал, как быстро можно обучить модель уровня GPT-2.NanocHat теперь т…

Карпаты показал, как быстро можно обучить модель уровня GPT-2.NanocHat теперь т...

⚡️ Карпаты показал, как быстро можно обучить модель уровня GPT-2.

NanocHat теперь тренирует модель с возможностями GPT-2 всего за 2 часа на одном узле с 8×H100. Еще месяц назад это занимало около 3 часов.

Главное улучшение оказалось не только в оптимизациях и FP8, а в смене датасета – с FineWeb-edu на NVIDIA ClimbMix. Другие датасеты вроде Olmo, FineWeb и DCLM давали регрессии, а ClimbMix сразу показал стабильный результат.

Но самое интересное другое.
Карпати подключил AI-агентов, которые автоматически экспериментируют с настройками nanocHat.

Агент работает так:
он создает feature-ветку, пробует разные идеи, тестирует их и автоматически мержит те, что улучшают метрики.

За ~12 часов агент сделал 110 изменений, снизив validation loss модели d12 с 0.862 → 0.858 без увеличения времени обучения.

Фактически модель теперь сама оптимизирует свой тренировочный пайплайн.

Карпати шутит, что последние недели он больше оптимизирует агентную систему, которая улучшает код, чем сам репозиторий nanocHat.

https://x.com/karpathy/status/2029701092347630069

View Source

Поделиться:

Ответить

Ваш адрес email не будет опубликован. Обязательные поля помечены *