- Главная
- Блог
- Новые ИИ-агенты выходят один за другим: как мы настроили стенд, чтобы не гоняться за каждым релизом
Новые ИИ-агенты выходят один за другим: как мы настроили стенд, чтобы не гоняться за каждым релизом

За последний месяц — Gemini 3.6 Flash от Google, Claude Opus 5 от Anthropic, перекроенная линейка GPT-5.6 от OpenAI, открытый Kimi K3 на 2,8 триллиона параметров от Moonshot. Каждый релиз новых ИИ-агентов приезжает с презентацией, где искусственный интеллект пишет код, планирует многочасовые задачи и делает работу за целую команду. Каждый обещает, что теперь-то всё изменится. Мы в «Интеллект Технологии» на такие волны наступали много раз и в этот раз наконец сделали то, что стоило сделать года полтора назад: собрали внутренний стенд, который за пару часов даёт понятный ответ — стоит ли на новой модели переделывать продакшен или пусть подождёт следующего релиза.
Раньше на такую проверку уходила почти неделя: инженер тыкал в чат, писал в блокнот впечатления, потом кто-то ещё пробовал, спорили. Теперь — пара часов, и есть таблица.
Почему топ ИИ-агентов из чужих бенчмарков ничего не решает
Первое, что все делают, когда выходит новая модель, — смотрят в рейтинги. LMSYS, HELM, локальные лидерборды, «топ ИИ-агентов месяца» из блогов. Мы через это прошли и держим в голове простую вещь: чужой бенчмарк меряет не вашу задачу.
Модель, которая выигрывает в олимпиадной математике, может не уметь возвращать строгий JSON под нашу схему. Модель, которая красиво пишет эссе, путается в шести вложенных tool call и зовёт функцию с половиной обязательных параметров. Модель, лидер в общем reasoning, на русских датах вида «после майских, ближе к обеду в четверг» иногда даёт результат хуже, чем средняя предыдущего поколения.
Плюс маркетинг. В презентациях показывают лучший из десяти прогонов на подготовленных примерах. В проде живут не подготовленные примеры, а прайс от поставщика в неведомой кодировке и коммерческое предложение с картинкой вместо таблицы.
Так что чужой топ — это ориентир, а не решение. Решение мы получаем на своём стенде.
Что этот стенд делает на самом деле
Стенд — не отдельная платформа с логотипом. Это набор задач из нашего продакшена, обёрнутый в код, который умеет прогнать одну и ту же задачу через разные модели и сравнить результаты.
Задачи мы отбирали больно. Не «напиши стих про кошку», а конкретные вещи, на которых у нас исторически спотыкались модели:
- разобрать телефонный разговор с клиентом в структурированную карточку заявки;
- прочитать УПД, где часть данных в подписи, часть в теле, часть в примечании;
- решить, какая из шести похожих позиций справочника 1С соответствует строке «Кабель ВВГ 3х2.5, не плоский, барабан 100м»;
- построить SQL к аналитической витрине с сотнями таблиц по человеческому вопросу;
- аккуратно разложить составной запрос вида «покажи договоры за квартал и заодно скажи, у кого просрочка».
Каждая задача — с эталонным ответом или чек-листом, который проверяется отдельной LLM-судьёй (мы намеренно держим судью из другого семейства, чтобы не спорила внутри своей группы). К каждой задаче — несколько вариаций с шумом: опечатки, кривая пунктуация, лишний текст в начале, обрезанный контекст. Именно вариации ловят хрупкие модели, которые красиво работают на чистом входе и разваливаются на реальном.
Как настроить ИИ-агента под честный тест
Дальше начинается инженерия. Правильно настроить ИИ-агента под сравнение — это не «сунуть один и тот же промпт в четыре API». Так делать нельзя, и вот почему.
Каждая модель по-своему любит быть промптована. GigaChat Pro лучше отвечает, когда роль и правила вынесены в system message коротким блоком без художеств. YandexGPT точнее с ярко выраженными разделителями. У зарубежных семейств свои повадки: одним нужны XML-теги, другим — markdown с плотным перечислением, третьим — примеры прямо внутри системного промпта. Если пихать общий промпт всем — победит та модель, под которую он случайно оказался ближе. Это не сравнение, это лотерея.
Мы делаем так. Под каждую модель хранится своя оболочка промпта: одинаковый смысл, разное оформление. Задача внутри — одна и та же. Схема ответа — одна и та же. Инструменты (MCP-серверы под 1С, наш поисковый слой по pgvector, доступ к нескольким внутренним сервисам) — одни и те же. Разное только то, что реально должно быть разным: формат обращения.
Параметры генерации — выравниваем. Нельзя одной модели дать температуру 0.2, а другой 0.7 и сравнивать. Температура минимальная, top_p жёсткий, никакого рандома там, где мы можем его убрать.
Отдельная история — инструменты. MCP-протокол за последний год стал стандартом де-факто: его подхватили и агентные фреймворки, и IDE, и корпоративные платформы. Это ровно то, что нам было нужно: раньше каждый новый ИИ-агент тянул за собой свою обёртку интеграций, теперь один MCP-сервер работает с любым фреймворком и любой моделью, у которой есть нормальный tool use. На стенде это дало эффект — мы перестали писать три версии одного и того же коннектора к 1С только ради теста.
Финальное — детерминированность. Каждый прогон логируется целиком: полный промпт, полный ответ, вызванные инструменты, аргументы, ответы инструментов, время каждого шага. Если результат вдруг стал странным, у нас есть трасса до последнего вызова. Не смутное впечатление «что-то она сегодня тупит», а конкретный лог.
Что показал стенд после июльской волны
Публично конкретные баллы приводить не буду — это внутренняя история и, честно, они устареют через две недели после следующего релиза. Но общие наблюдения такие.
Модели, заточенные под агентные сценарии, действительно стали заметно надёжнее в многошаговых задачах. Там, где полгода назад ИИ-агент из четырёх шагов ломался на третьем и звал функцию с пустыми аргументами, теперь чаще доходит до конца. Лёгкие production-модели новой волны — те, что позиционируются как быстрый workhorse для агентных workflow, — оказались приятным сюрпризом: на наших внутренних задачах выступают лучше, чем ожидаешь по цене за токен.
Российские модели держат свою нишу. GigaChat Pro на задачах, где надо работать с русским деловым языком, документами и специфической терминологией из 1С, у нас часто обходит более разрекламированных иностранных конкурентов — при том, что данные никуда не уходят из контура заказчика. Это до сих пор главный аргумент. Ни один «топ ИИ-агентов» из англоязычного блога этого не покажет, потому что там таких задач нет.
Открытые модели вроде свежего Kimi K3 интересны тем, что их можно поднять локально. Для сценариев с 152-ФЗ и закрытым периметром это иногда единственный вариант, где выбираешь не между лучшим и вторым, а между этим и вообще ничем.
Финал: не топ, а таблица «подходит — не подходит»
Главное, что дал стенд, — мы перестали спорить. Раньше решение «переходим на новую модель» принималось на интуиции старшего инженера. Сейчас — по таблице, которую видят все. Иногда таблица говорит «да, стоит переключить вон тот кусок». Иногда — «на нашей задаче старая модель до сих пор выигрывает, не трогайте». Иногда — «интересно, но подождём минорной версии, потому что стабильно валит одну из вариаций».
Если вы разрабатываете ИИ-агентов для бизнеса и хотя бы раз в квартал думаете «а не переехать ли на свежий релиз» — своя оценка окупается за пару итераций. Чужие рейтинги ответят на общий вопрос, ваша задача — только на свою. И в мире, где новые ИИ-агенты выходят чуть ли не каждую неделю, второй ответ важнее первого.
Похожие статьи
- Собрали ИИ-агента в n8n за вечер, через месяц переписали ядро на Python: где мы провели границу
- Готовые ИИ-агенты появляются каждую неделю: как мы выбираем — взять с полки или собрать под клиента
- Обновление MCP 2026-07-28: как stateless-архитектура и долгие задачи поменяли настройку наших ИИ-агентов
- Как мы выбирали ИИ-агента-помощника для своих разработчиков: MCP, наш монорепо и один тихий дисквалификатор




