Чего на самом деле хотят от AI-инженера

Поиск по запросу «как стать AI-инженером» выдаёт одну и ту же лестницу: Python, математика, трансформеры, файнтюнинг, а в идеале ещё и собственная статья. Год по этому маршруту, и вы готовы к работе, которой во всём мире занято несколько сотен человек. Под одним названием прячутся минимум четыре разные профессии, и человек, который дообучает модели, в понедельник не сможет делать работу того, кто прикручивает агента к тикет-системе.

Что говорят данные

Алексей Григорьев выгрузил 4894 описания вакансий AI-инженеров с builtin.com по Лос-Анджелесу, Нью-Йорку, Лондону, Амстердаму, Берлину и Индии, шестью проходами с февраля по июнь 2026 года. Пока это единственный публичный датасет, где на вопрос «что реально спрашивают» отвечают цифрами. Исследование целиком лежит тут: https://github.com/alexeygrigorev/ai-engineering-field-guide

Классический ML со scikit-learn и обучающим циклом встречается в 1,9% вакансий с этим названием, а к июню доля упала до 1,2%. Зато 72,9% работают прямо с AI-системами: поиск по документам, агенты, промпты и контекст. Ещё 24,5% обслуживают платформы и пайплайны, на которых живёт первая группа.

Внутри AI-first ролей 93,1% требуют навыков за пределами генеративных моделей, и только 1,4% ограничиваются чистым GenAI. Это фулстек-работа в новой шляпе, и сдавать вы будете работающий сервис.

RAG упоминается в 34,1% вакансий и остаётся самым частым паттерном в датасете. 64,3% AI-first ролей всё ещё просят знание ML: фундамент переехал из содержания работы в цену входа. Быстрее всего в данных растёт SQL, с 9,8% до 34,8% за пять месяцев.

Что компании сейчас строят

Тот же датасет отслеживает 24 502 сценария применения. С февраля по июнь выросли автоматизация ручных процессов (с 62,2% до 72,9%), внутренние операции вроде рисков, комплаенса, фрода и страховых выплат (с 50,6% до 64,2%), поиск по документам (с 39,4% до 49,4%) и агентные системы (с 48,5% до 55,3%).

Упали персонализация (с 18% до 8,6%), ответы на вопросы клиентов (с 40,1% до 32,4%) и исследования с экспериментами как отдельная обязанность (с 43,1% до 30,1%, крупнейшее падение во всём датасете).

Эпоха чат-ботов закончилась. Бизнесу нужна система, которая доводит процесс до конца внутри компании, на собственных данных, и работает, когда рядом никто не стоит. Автор сразу оговаривается: категории размечены по ключевым словам, один сценарий может попасть сразу в несколько групп, так что читать стоит направление движения, точность до десятых здесь иллюзорна.

Путь первый: инженер LLM-приложений

Вы строите продукт поверх модели, которую обучил кто-то другой. Модель здесь просто зависимость, вроде базы данных, и всё вокруг неё ваша работа. Если кластеризовать 4894 вакансии по набору навыков, самая большая группа на 25,6% рынка это сборщик RAG-приложений: RAG 90%, векторные базы 71%, LangChain 64%. Кластер агентов добавляет ещё 16,9%. LangGraph подрос с 37,7% до 48,5%, а файнтюнинг как обязанность просел с 15,4% до 12,0%.

Как это выглядит в жизни. Юристам нужны ответы по четырём тысячам договоров. Вы режете документы на куски, потому что модель не прочтёт четыре тысячи договоров на каждый вопрос. Порежете неудачно, и поиск вернёт оглавление вместо нужного пункта. Каждый кусок становится вектором, вопрос тоже, вы подтягиваете ближайшие куски в промпт. Кто-то спрашивает, что изменилось в продлениях 2024 года, а поиск понятия не имеет, что такое продление. Вы добавляете фильтры по метаданным. Потом приходит кусок с номером пункта, но без названия договора. Потом приходит счёт за токены.

Что читать: https://applied-llms.org, где шесть практиков разбирают, что ломается в проде; https://www.anthropic.com/engineering/contextual-retrieval про контекст внутри чанков, BM25 и реранк; https://www.anthropic.com/engineering/building-effective-agents с пятью составными паттернами; https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents про контекст как бюджет; https://jxnl.co/writing/2025/01/24/systematically-improving-rag-applications про синтетические выборки и роутинг; https://manus.im/blog/Context-Engineering-for-AI-Agents-Lessons-from-Building-Manus про экономику KV-кеша; https://www.trychroma.com/research/evaluating-chunking с бенчмарком по чанкингу.

Путь второй: инженер AI-платформы

Вы строите платформу, которой пользуются те, кто делает приложения. Шлюз, роутинг, кеширование, квоты, разнесение расходов по командам, наблюдаемость. Это те самые 24,5%, примерно две трети из них платформа и инфраструктура. AWS встречается в 40,0% вакансий, Docker в 35,2%, Kubernetes в 29,4%, CI/CD вырос с 29,8% до 37,7%.

Дальше начинается самое неожиданное. Про инференс говорят все, но vLLM встречается в 1,5% AI-first вакансий и доля падает, Triton в 0,9%, а самостоятельный хостинг моделей записан в обязанности у 2,5%. Интеграция API при этом в 62,4%. Платформенная работа сегодня крутится вокруг шлюза.

Как это выглядит в жизни. Три команды ходят к четырём провайдерам со своими ключами, и никто не может сказать, чей это счёт за AI. Вы ставите перед ними шлюз, каждый вызов получает тег команды, алиас модели и бюджет по токенам. Потом основной провайдер начинает деградировать в четыре часа дня, и нужен фолбэк, который не поменяет формат ответа втихую. Потом кеширование промптов срезает стоимость того же трафика в пять раз. Потом кто-то выкатывает ретраи без бэкоффа, и выясняется, что ваш рейт-лимитер живёт внутри одного процесса.

Что читать: https://www.tensoreconomics.com/p/llm-inference-economics-from-first про себестоимость токена; https://docs.litellm.ai/docs/proxy/cost_tracking про учёт трат; https://aigateway.envoyproxy.io/docs/capabilities про лимиты и фейловер; https://platform.claude.com/docs/en/build-with-claude/prompt-caching про кеширование промптов; https://developer.nvidia.com/blog/llm-benchmarking-fundamental-concepts про TTFT и ITL; https://modal.com/llm-almanac/advisor с замерами на H100; https://vllm.ai/blog/2025-09-05-anatomy-of-vllm про устройство vLLM.

Путь третий: ML-инженер

Вы обучаете и адаптируете модели. Ровно тот путь, который описывают все роадмапы, и почти никто по нему не нанимает. 91 вакансия из 4894, к июню это 1,2%. Кластер тренеров занимает 8,3% рынка и сжимается, RLHF ужался с 1,8% до 0,9%, чистые тренерские роли упали с 12,1% до 5,9%. PyTorch и TensorFlow сильно перевешивают в публичных и поздних компаниях и почти пропадают на стадиях от сида до раунда A.

Как это выглядит в жизни. Классификатор решает, является ли обращение в поддержку запросом на возврат. Промптинг фронтир-модели даёт 91% при 0,004 доллара за тикет и 300 миллисекундах. Вы размечаете 4000 тикетов, дообучаете трёхмиллиардную модель через QLoRA и получаете 96% при 0,0002 доллара и 40 миллисекундах. Вот и весь бизнес-кейс файнтюнинга в 2026 году: узкая задача, большой объём, потолок по цене или задержке. Потом продукт переименовывает категории, выборка протухает, и выясняется, что настоящая работа здесь разметка.

Что читать: https://cs336.stanford.edu с бесплатным курсом Стэнфорда; https://github.com/karpathy/nanochat с читаемым кодом претрейна, SFT, RL и инференса; https://huggingface.co/spaces/HuggingFaceTB/smol-training-playbook с логами абляций; https://unsloth.ai/docs/get-started/reinforcement-learning-rl-guide с объяснением GRPO; https://huggingface.co/docs/trl/en/grpo_trainer с выводом лосса; https://magazine.sebastianraschka.com/p/the-state-of-llm-reasoning-model-training про ризонинг-модели; https://arxiv.org/abs/2305.14314 про QLoRA. Torchtune можно пропустить, Meta свернула его в 2025 году.

Путь четвёртый: forward-deployed инженер

Вы сидите внутри бизнес-подразделения и превращаете ручной процесс в автоматический. Половина работы здесь вообще не про код. Это самая быстрорастущая роль в датасете: живых вакансий стало 118 против 28, рост в 4,2 раза при 2,3 раза по рынку. 91% работают напрямую с клиентом, джуниорских позиций ноль. Python в 91%, промпт-инжиниринг в 55%, RAG в 52%, агенты в 42%.

Как это выглядит в жизни. Отдел урегулирования обрабатывает 800 документов в день руками. Вы два дня сидите рядом с ними, прежде чем написать хоть строчку, потому что процесс в вики и реальный процесс живут отдельно друг от друга. Ваша извлекалка берёт 94% полей верно. Звучит прилично, пока не посчитаешь, что это ошибка каждые шестнадцать документов, а бизнес терпит одну на пятьсот. Поэтому решение остаётся за человеком, вы автоматизируете извлечение и сдаёте очередь вместо оракула. И меряете минуты на одно дело, потому что именно за эту цифру вам продлят бюджет.

Что смотреть и читать: https://www.youtube.com/watch?v=KwhgfwOSToQ с Кевином Баем из Palantir и Anthropic; https://www.youtube.com/watch?v=ITMXwI6QL6A с Лео Мером из Ramp про скоупинг; https://sierra.ai/blog/benchmarking-ai-agents про метрику pass^k; https://www.anthropic.com/engineering/writing-tools-for-agents про инструменты для агентов; https://modelcontextprotocol.io/docs/develop/build-server с рабочим MCP-сервером; https://www.anthropic.com/engineering/code-execution-with-mcp про выполнение кода через MCP; https://www.palantir.com/docs/foundry/architecture-center/ontology-system про онтологию бизнеса.

Навык, который решает во всех четырёх

Оценка качества нигде не вынесена в отдельную вакансию, но именно она определяет, чьё демо доедет до прода. Оценка и качество указаны как обязанность в 68,5% всех 4894 вакансий, а 39,6% AI-first ролей прямо требуют навыков оценки. При этом сам инструментарий, LangSmith, Langfuse и явно названная оценка LLM, встречается только в 9,1% и 12,4% случаев. Компании знают, что им это нужно, и не умеют сформулировать, что именно просить. Здесь и лежит арбитраж.

Как это выглядит в жизни. До того как что-то строить, напишите 30 вопросов и ответы, которые вы готовы принять. Потом руками прочитайте 100 неудачных трейсов и своими словами запишите, что пошло не так. Сгруппируйте заметки. Найдётся три или четыре типа ошибок, которые покрывают почти всё, и окажутся они совсем не теми, что вы предполагали. Дальше собираете LLM-судью и сверяете его с собственной разметкой, меняете одну вещь, считаете снова и оставляете только то, что сдвинуло цифру.

Что читать: https://hamel.dev/blog/posts/field-guide про анализ ошибок в первую очередь; https://hamel.dev/blog/posts/evals-faq с сорока неудобными вопросами; https://hamel.dev/blog/posts/llm-judge с семью шагами к судье; https://eugeneyan.com/writing/llm-evaluators с двумя дюжинами статей; https://langfuse.com/blog/2025-08-29-error-analysis-to-evaluate-llm-applications про таксономию ошибок; https://arxiv.org/abs/2404.12272 про дрейф критериев; https://www.deeplearning.ai/courses/evaluating-ai-agents с бесплатным курсом про оценку агентов.

Если в резюме пока ничего этого нет

Джуниорских вакансий на этом рынке 1,0%. Начальной ступени просто нет, поэтому её перепрыгивают и сразу предъявляют доказательство.

Опубликуйте один разбор ошибок. Возьмите любую LLM-систему, прогоните 50 или 100 реальных трейсов, руками разметьте каждый сбой и выложите таксономию с цифрой до и после. Хамель Хусейн называет анализ ошибок самым окупаемым занятием в разработке AI. Юджин Ян, который нанимал ML-инженеров в Amazon и теперь работает в Anthropic, смотрит именно на чутьё к данным, которое такой разбор показывает. Задеплоенное RAG-демо его не заменяет, демо никто не смотрит.

Получайте за это деньги и объём. Фронтир-лаборатории отдают на аутсорс написание оценок и проектирование RL-сред и берут на это обычных программистов. Mercor платит от 40 до 200 долларов в час: https://www.mercor.com/experts/software-engineers. У Surge висит вакансия на 250 тысяч долларов с требованием двух-шести лет обычного бэкенда: https://surgehq.ai/careers/software-engineer-coding-evaluation-training-data. Готовьтесь к текучке: Mercor резал ставки с 21 до 16 долларов в час и за день распустил проект на 5000 человек через неделю после оценки в 10 миллиардов. Это оплачиваемые подходы к снаряду, а у вас остаётся строчка о том, что вы писали оценки для фронтир-модели.

Ред-тиминг остаётся единственным маршрутом с опубликованной конверсией. Gray Swan выплатила больше 500 тысяч долларов и сделала больше 100 приватных размещений, там же бесплатная тренировочная лестница и живой челлендж на 20 тысяч: https://app.grayswan.ai/arena

Один смерженный пул-реквест в правильном репозитории работает так же. У LangChain, LlamaIndex, DSPy, Langfuse, promptfoo, Phoenix и репозитория MCP-серверов на всех ноль открытых задач с меткой good first issue. У vLLM их больше сорока и их реально поддерживают: https://github.com/vllm-project/vllm/contribute. У OpenHands сорок, обновлённых в прошлом месяце.

Где искать сами вакансии: https://aijobs.net с 48 тысячами позиций и выгрузкой в CSV и JSON; https://hnhiring.com с ежемесячным тредом HN в удобном виде; https://wellfound.com/role/ai-engineer с 4500 ролей и вилкой прямо в карточке; https://algora.io/bounties с баунти в опенсорсе от 500 до 3500 долларов.

Куда идти лично вам

Если вы уже пишете софт, берите первый путь, там короче дорога и больше рынок. Любите системы и считаете деньги, вам во второй, и хайп вокруг инференса можно пропустить. Третий имеет смысл, если целитесь в поздние стадии и публичные компании. Хорошо работаете с людьми и плохо переносите абстракции, идите в четвёртый, он растёт вчетверо быстрее рынка. Пятый обязателен в любом из них: вместо джуниорской ступени рынок теперь требует доказательство, что ваша система работает, и оценки единственный способ его получить.

Один датасет, один момент времени, одна биржа вакансий. Пользуйтесь этим как картой местности. Оригинальный разбор лежит тут: https://x.com/undefinedKi/status/2083549085076701434

Поделиться:

Ответить

Ваш адрес email не будет опубликован. Обязательные поля помечены *