Карпаты показал, как быстро можно обучить модель уровня GPT-2.NanocHat теперь т…

NanocHat теперь тренирует модель с возможностями GPT-2 всего за 2 часа на одном узле с 8×H100. Еще месяц назад это занимало около 3 часов.
Главное улучшение оказалось не только в оптимизациях и FP8, а в смене датасета – с FineWeb-edu на NVIDIA ClimbMix. Другие датасеты вроде Olmo, FineWeb и DCLM давали регрессии, а ClimbMix сразу показал стабильный результат.
Но самое интересное другое.
Карпати подключил AI-агентов, которые автоматически экспериментируют с настройками nanocHat.
Агент работает так:
он создает feature-ветку, пробует разные идеи, тестирует их и автоматически мержит те, что улучшают метрики.
За ~12 часов агент сделал 110 изменений, снизив validation loss модели d12 с 0.862 → 0.858 без увеличения времени обучения.
Фактически модель теперь сама оптимизирует свой тренировочный пайплайн.
Карпати шутит, что последние недели он больше оптимизирует агентную систему, которая улучшает код, чем сам репозиторий nanocHat.





