Почему серьёзные ИИ-проекты уходят от vLLM в 2026 году

Счета за инференс растут с каждым новым агентом и каждым дополнительным вызовом модели. В продакшене команды всё чаще перекладывают рутинные шаги на маленькие специализированные модели, чтобы удержать расходы. Андрей Карпатый недавно высказал похожую мысль на уровне самой модели: небольшого когнитивного ядра примерно на миллиард параметров, дистиллированного из крупной модели, хватает для той работы, где действительно нужно рассуждать.

Сложность в том, что сам по себе переход на маленькие модели денег не экономит. Их всё равно нужно где-то запускать, а сделать это без простоя дорогого GPU — отдельная задача.

vLLM и TEI построены вокруг одной модели, поэтому четыре модели на одной карте требуют четыре отдельных процесса, которые никто не координирует. Каждый забирает память заранее и не видит соседей. У vLLM резерв памяти по умолчанию 90 процентов карты при старте, так что разбиение памяти приходится считать вручную ещё до первого трафика. Если две модели всплеснут одновременно, они уронят всю карту.

Есть и три привычных пути обхода, и каждый меняет одну проблему на другую. Управляемый API вроде OpenAI или Cohere избавляет от GPU, но на масштабе счёт растёт линейно, а данные уходят наружу. Бессерверные GPU решают простой на бумаге, но холодный старт добавляет секунды к первому запросу, а чтобы его избежать, экземпляры держат тёплыми и снова платят за простой. Третий вариант, самохостинг на арендованных картах, даёт и цену, и контроль, но возвращает к вопросу про стандартные инструменты.

Решает это открытый Superlinked Inference Engine, или SIE. Он работает как один кластер внутри вашего облака и запускает эмбеддинги, реранкинг, OCR, зрение, экстракцию и генерацию за одним API с четырьмя вызовами: encode, score, extract и generate. Он плотно пакует запросы по стоимости вычислений, загружает модель при первом запросе и выгружает давно не использованную, когда памяти мало, точно как кэш браузера.

Маленькие специализированные модели для узких задач это верный подход, но экономия появляется только когда модели делят GPU, а для этого нужен единый движок. Репозиторий: github.com/superlinked/sie

+1
0
+1
0
+1
0
+1
0
+1
0

Ответить

Ваш адрес email не будет опубликован. Обязательные поля помечены *