1. Главная
  2. Блог
  3. ИИ-агенты для кода глазами команды, которая сама разрабатывает ИИ-агентов: разбор Hermes, клода и GPT после августовских релизов

ИИ-агенты для кода глазами команды, которая сама разрабатывает ИИ-агентов: разбор Hermes, клода и GPT после августовских релизов

ИИ-агенты для кода глазами команды, которая сама разрабатывает ИИ-агентов: разбор Hermes, клода и GPT после августовских релизов

Ситуация знакомая любому техлиду. В один и тот же спринт выходит мажорный релиз Hermes Agent (v0.20.0, 3 августа), до этого — Claude Opus 5 и GPT-5.6 Sol. Разработчики уже неделю приходят с «а давайте попробуем», «а на этом задача решается за полчаса», «а этот в бенчмарке лидер». А у тебя рабочий бэклог, тесты, релиз в четверг и трое новичков, которых надо ввести в проект.

Мы в «Интеллект Технологии» разрабатываем ИИ-агентов для бизнеса — от секретарей и text2SQL до интеграций с 1С. И поэтому к вопросу «а чем сегодня писать код» подходим не как энтузиасты, а как люди, которые видят изнанку: как языковые модели ведут себя на длинной сессии, где ломается инструмент, во что обходится контекст. Ниже — как мы выбирали, что оставить в ежедневной работе разработчика после августовских релизов, и почему в итоге у нас не один любимчик, а связка. Тема — про ии агенты для кода в честном инженерном разрезе.

Почему ИИ-агенты для кода — это отдельная задача, а не «просто чат-бот с плагином»

Сначала важная развилка. Ассистент, который дописывает функцию по подсказке, и ИИ-агент, который сам открывает файлы, гоняет тесты, ловит трейсбек и правит миграцию, — это два разных инструмента. Первый экономит минуты. Второй меняет то, как выглядит рабочий день.

Раньше мы жили с ассистентом и не жаловались. Пока задача — «допиши handler», разницы почти нет. Как только задача становится «разберись, почему на стейдже 502 после последнего PR» — ассистент выдаёт хвост из подсказок, а нужен исполнитель. Именно здесь начали появляться ИИ-агенты для кода: с доступом к файловой системе, к терминалу, к тестам, с памятью на всю сессию.

Hermes ИИ-агент v0.20.0: что реально поменялось

Свежий Hermes Agent мы поставили сразу, как только увидели changelog. Формально в этом релизе — тысячи закрытых issues и больше тысячи PR. Это масштаб не косметики, а перекладки основы. Что бросилось в глаза за первую неделю на живых задачах:

  • Планировщик стал заметно устойчивее к длинным цепочкам. Раньше на многошаговой задаче — «пробеги по трём сервисам, найди источник расхождения» — Hermes любил уходить в цикл и звонить в один и тот же инструмент подряд. Сейчас видно: если действие не даёт нового результата, агент меняет стратегию.
  • Работа с открытыми весами. Для нас это ключевая история — часть задач мы принципиально не хотим гонять в чужое облако. Hermes ии агент хорошо ложится на локальный запуск, и это не «в теории», а «инженер садится и работает».
  • Инструменты стали предсказуемее. Появились режимы разрешений — можно закрыть агенту доступ к сетевым запросам на разборе инцидента и открыть только к нужным репозиториям.

Минусы тоже назовём честно. На тонкой работе с большими фронтенд-компонентами (Angular, много вложенных сигналов) Hermes всё ещё уступает старшим коммерческим моделям — торопится и любит переписывать больше, чем просили. Мы это ловим через жёсткие снапшот-тесты и запрет на массовое переименование без апрува.

ИИ-агент клод: Claude Opus 5 в Claude Code

Claude Opus 5 вышел ближе к концу июля, и Claude Code с 24 июля начал ходить в него по умолчанию. Мы этим пользуемся ровно там, где оправдано: обзор чужих PR, разбор архитектурных развилок, длинные рефакторинги с сохранением контекста на десятки файлов. Ии агент клод хорош, когда важнее «понять и объяснить», чем «быстро сделать».

Что понравилось на августовских задачах:

  • Умеет держать нить на длинных сессиях без склеротических провалов. Мы гоняли его на разборе легаси-модуля, где логика размазана по пяти сервисам, — он не терял, кто кому что дёргает.
  • Хорошо работает с ошибочными предпосылками. Если разработчик описал баг неверно, Claude чаще других останавливается и переспрашивает, а не бросается чинить.
  • Разрешения и workspace-trust prompts в свежих обновлениях Claude Code — уже не игрушка, а норма. Разработчик видит, что агент собирается сделать, до того, как это сделано.

Слабое место — стоимость длинных сессий и то, что часть команды сидит на не самом быстром интернете. На созвоне из региона агент временами превращается в «жду ответа», и это раздражает.

ИИ-агент GPT: Codex на GPT-5.6 Sol

GPT-5.6 Sol с 9 июля стал моделью по умолчанию в Codex, и в свежих бенчмарках Terminal-Bench он уверенно наверху. Плюс к этому в июльском обновлении Copilot добавили Codex как провайдера агентов в CLI и JetBrains — то есть ии агент gpt теперь живёт не только в веб-интерфейсе, а прямо в привычной IDE.

Наш опыт за последние недели:

  • В терминальных задачах — самый быстрый и самый «прикладной». Скрипты миграций, разбор логов, массовые правки — Codex делает работу минимальными шагами.
  • В корпоративном контексте (Gartner Magic Quadrant 2026 — не просто маркетинг) видно, что подтянулись фичи для больших команд: аудит действий, ограничения на инструменты, интеграция с внутренними системами.
  • Контекст на миллион токенов на совместимых моделях — не для красоты. Один раз мы засунули туда почти весь монорепозиторий на разбор архитектурного отчёта, и это реально сработало без нарезки на куски.

Из минусов — стиль. Codex любит писать «чисто по учебнику», и на живом коде это выглядит как навязчивая уборка: переставит импорты, поменяет кавычки, добавит комментарии, которых никто не просил. Ограничили это правилами в конфиге и договорённостями внутри команды.

Как мы делим задачи между агентами

Практика показала: одного «лучшего» ИИ-агента для кода не существует. Есть комбинация под задачу.

  • Разбор инцидента, длинный контекст, «объясни, почему это работает так» — Claude.
  • Быстрые терминальные задачи, миграции, скрипты, тюнинг Dockerfile — Codex.
  • Работа внутри защищённого контура, без выхода наружу, — Hermes на локальных весах. Здесь же — эксперименты с новыми ролями: агент-ревьюер, агент-документатор.
  • Массовые однотипные правки по репозиторию — сначала Hermes на локали, только потом дорогая модель на финальную проверку.

Раньше на разбор нетривиального бага у нас уходил день с перерывом на кофе и ругательства. Сейчас первые гипотезы приходят до обеда, и остаток дня — на проверку, а не на копание в логах.

Что важнее, чем «какая модель лучше»

Мы для себя вывели простую вещь: ии агенты для кода живут не в вакууме, а в инженерной культуре. Если у тебя нет тестов, версионирования промптов, разрешений на действия и разбора логов агента — любая топ-модель за неделю превратит проект в свалку.

Поэтому вокруг любого агента, которого мы пускаем в код, стоит одна и та же обвязка: снапшот-тесты, запрет на массовые правки без ревью, лог действий агента как отдельный артефакт, регулярный разбор его ошибок. Ровно то же самое мы строим клиентам, когда собираем ИИ-агента для их бизнеса на GigaChat Pro или YandexGPT, — просто там вместо PR и миграций стоят договоры, заявки и CRM.

И это, пожалуй, главный вывод. Августовские релизы показали: гонка моделей продолжается, лидер меняется каждый квартал. А инженерия вокруг агента — то, что делает разницу между «поиграли и забыли» и «стало частью рабочего дня». А вы чем сейчас пишете код — и, главное, как устроена обвязка вокруг?

Похожие статьи

Хотите так же?

Обсудим, как это внедрить у вас

Опишите задачу — подберём ИИ-решение под ваш процесс и бюджет: что сделать агентом, какие нужны данные и интеграции, с чего начать пилот.