- Главная
- Блог
- ИИ-агенты для кода глазами команды, которая сама разрабатывает ИИ-агентов: разбор Hermes, клода и GPT после августовских релизов
ИИ-агенты для кода глазами команды, которая сама разрабатывает ИИ-агентов: разбор Hermes, клода и GPT после августовских релизов

Ситуация знакомая любому техлиду. В один и тот же спринт выходит мажорный релиз Hermes Agent (v0.20.0, 3 августа), до этого — Claude Opus 5 и GPT-5.6 Sol. Разработчики уже неделю приходят с «а давайте попробуем», «а на этом задача решается за полчаса», «а этот в бенчмарке лидер». А у тебя рабочий бэклог, тесты, релиз в четверг и трое новичков, которых надо ввести в проект.
Мы в «Интеллект Технологии» разрабатываем ИИ-агентов для бизнеса — от секретарей и text2SQL до интеграций с 1С. И поэтому к вопросу «а чем сегодня писать код» подходим не как энтузиасты, а как люди, которые видят изнанку: как языковые модели ведут себя на длинной сессии, где ломается инструмент, во что обходится контекст. Ниже — как мы выбирали, что оставить в ежедневной работе разработчика после августовских релизов, и почему в итоге у нас не один любимчик, а связка. Тема — про ии агенты для кода в честном инженерном разрезе.
Почему ИИ-агенты для кода — это отдельная задача, а не «просто чат-бот с плагином»
Сначала важная развилка. Ассистент, который дописывает функцию по подсказке, и ИИ-агент, который сам открывает файлы, гоняет тесты, ловит трейсбек и правит миграцию, — это два разных инструмента. Первый экономит минуты. Второй меняет то, как выглядит рабочий день.
Раньше мы жили с ассистентом и не жаловались. Пока задача — «допиши handler», разницы почти нет. Как только задача становится «разберись, почему на стейдже 502 после последнего PR» — ассистент выдаёт хвост из подсказок, а нужен исполнитель. Именно здесь начали появляться ИИ-агенты для кода: с доступом к файловой системе, к терминалу, к тестам, с памятью на всю сессию.
Hermes ИИ-агент v0.20.0: что реально поменялось
Свежий Hermes Agent мы поставили сразу, как только увидели changelog. Формально в этом релизе — тысячи закрытых issues и больше тысячи PR. Это масштаб не косметики, а перекладки основы. Что бросилось в глаза за первую неделю на живых задачах:
- Планировщик стал заметно устойчивее к длинным цепочкам. Раньше на многошаговой задаче — «пробеги по трём сервисам, найди источник расхождения» — Hermes любил уходить в цикл и звонить в один и тот же инструмент подряд. Сейчас видно: если действие не даёт нового результата, агент меняет стратегию.
- Работа с открытыми весами. Для нас это ключевая история — часть задач мы принципиально не хотим гонять в чужое облако. Hermes ии агент хорошо ложится на локальный запуск, и это не «в теории», а «инженер садится и работает».
- Инструменты стали предсказуемее. Появились режимы разрешений — можно закрыть агенту доступ к сетевым запросам на разборе инцидента и открыть только к нужным репозиториям.
Минусы тоже назовём честно. На тонкой работе с большими фронтенд-компонентами (Angular, много вложенных сигналов) Hermes всё ещё уступает старшим коммерческим моделям — торопится и любит переписывать больше, чем просили. Мы это ловим через жёсткие снапшот-тесты и запрет на массовое переименование без апрува.
ИИ-агент клод: Claude Opus 5 в Claude Code
Claude Opus 5 вышел ближе к концу июля, и Claude Code с 24 июля начал ходить в него по умолчанию. Мы этим пользуемся ровно там, где оправдано: обзор чужих PR, разбор архитектурных развилок, длинные рефакторинги с сохранением контекста на десятки файлов. Ии агент клод хорош, когда важнее «понять и объяснить», чем «быстро сделать».
Что понравилось на августовских задачах:
- Умеет держать нить на длинных сессиях без склеротических провалов. Мы гоняли его на разборе легаси-модуля, где логика размазана по пяти сервисам, — он не терял, кто кому что дёргает.
- Хорошо работает с ошибочными предпосылками. Если разработчик описал баг неверно, Claude чаще других останавливается и переспрашивает, а не бросается чинить.
- Разрешения и workspace-trust prompts в свежих обновлениях Claude Code — уже не игрушка, а норма. Разработчик видит, что агент собирается сделать, до того, как это сделано.
Слабое место — стоимость длинных сессий и то, что часть команды сидит на не самом быстром интернете. На созвоне из региона агент временами превращается в «жду ответа», и это раздражает.
ИИ-агент GPT: Codex на GPT-5.6 Sol
GPT-5.6 Sol с 9 июля стал моделью по умолчанию в Codex, и в свежих бенчмарках Terminal-Bench он уверенно наверху. Плюс к этому в июльском обновлении Copilot добавили Codex как провайдера агентов в CLI и JetBrains — то есть ии агент gpt теперь живёт не только в веб-интерфейсе, а прямо в привычной IDE.
Наш опыт за последние недели:
- В терминальных задачах — самый быстрый и самый «прикладной». Скрипты миграций, разбор логов, массовые правки — Codex делает работу минимальными шагами.
- В корпоративном контексте (Gartner Magic Quadrant 2026 — не просто маркетинг) видно, что подтянулись фичи для больших команд: аудит действий, ограничения на инструменты, интеграция с внутренними системами.
- Контекст на миллион токенов на совместимых моделях — не для красоты. Один раз мы засунули туда почти весь монорепозиторий на разбор архитектурного отчёта, и это реально сработало без нарезки на куски.
Из минусов — стиль. Codex любит писать «чисто по учебнику», и на живом коде это выглядит как навязчивая уборка: переставит импорты, поменяет кавычки, добавит комментарии, которых никто не просил. Ограничили это правилами в конфиге и договорённостями внутри команды.
Как мы делим задачи между агентами
Практика показала: одного «лучшего» ИИ-агента для кода не существует. Есть комбинация под задачу.
- Разбор инцидента, длинный контекст, «объясни, почему это работает так» — Claude.
- Быстрые терминальные задачи, миграции, скрипты, тюнинг Dockerfile — Codex.
- Работа внутри защищённого контура, без выхода наружу, — Hermes на локальных весах. Здесь же — эксперименты с новыми ролями: агент-ревьюер, агент-документатор.
- Массовые однотипные правки по репозиторию — сначала Hermes на локали, только потом дорогая модель на финальную проверку.
Раньше на разбор нетривиального бага у нас уходил день с перерывом на кофе и ругательства. Сейчас первые гипотезы приходят до обеда, и остаток дня — на проверку, а не на копание в логах.
Что важнее, чем «какая модель лучше»
Мы для себя вывели простую вещь: ии агенты для кода живут не в вакууме, а в инженерной культуре. Если у тебя нет тестов, версионирования промптов, разрешений на действия и разбора логов агента — любая топ-модель за неделю превратит проект в свалку.
Поэтому вокруг любого агента, которого мы пускаем в код, стоит одна и та же обвязка: снапшот-тесты, запрет на массовые правки без ревью, лог действий агента как отдельный артефакт, регулярный разбор его ошибок. Ровно то же самое мы строим клиентам, когда собираем ИИ-агента для их бизнеса на GigaChat Pro или YandexGPT, — просто там вместо PR и миграций стоят договоры, заявки и CRM.
И это, пожалуй, главный вывод. Августовские релизы показали: гонка моделей продолжается, лидер меняется каждый квартал. А инженерия вокруг агента — то, что делает разницу между «поиграли и забыли» и «стало частью рабочего дня». А вы чем сейчас пишете код — и, главное, как устроена обвязка вокруг?
Похожие статьи
- Готовые ИИ-агенты появляются каждую неделю: как мы выбираем — взять с полки или собрать под клиента
- Обновление MCP 2026-07-28: как stateless-архитектура и долгие задачи поменяли настройку наших ИИ-агентов
- Как мы выбирали ИИ-агента-помощника для своих разработчиков: MCP, наш монорепо и один тихий дисквалификатор
- Новые ИИ-агенты выходят один за другим: как мы настроили стенд, чтобы не гоняться за каждым релизом




