Красная папка: как мы учим ИИ-агента после запуска и не чиним всё подряд
Первые две недели после запуска ИИ-агента для отдела продаж — самое опасное время. Клиент уже доверил агенту живой трафик, менеджеры впервые видят, как их работу делает не человек, и на почту сыпется десяток «а вот тут он опять сказал ерунду». Соблазн один — открыть код и починить прямо сейчас. Мы через это прошли и знаем: если чинить каждую жалобу на лету, через месяц агент будет работать хуже, чем в день запуска.
Расскажу, как мы перестали кидаться на каждую ошибку и выстроили обучение ИИ-агентов уже после того, как они вышли в бой. Спойлер: главным инструментом оказалась не платформа для дообучения и не хитрая метрика, а обычная папка, куда попадают все спорные ответы.
Первый подход: чинить всё, как только пришло
Когда мы только начинали разрабатывать ИИ-агентов под клиентов, план был честный. Живёт агент — принимаем обратную связь — правим промпт. Менеджер жалуется, что агент неправильно посчитал скидку. Открываем шаблон, добавляем строчку «внимательно проверяй условия акции», деплоим.
Через неделю таких строчек в системном промпте становится штук двадцать. Через две — агент начинает вести себя странно на задачах, которые до этого проходил идеально. Мы всерьёз чинили одно место и незаметно ломали другое. Проверить регресс негде: тестовый набор мы вели формально, а живой трафик каждый день был новый.
И ещё одна тонкость. Половина жалоб от менеджеров при разборе оказывалась не ошибками агента, а несогласием оператора с ответом. Кто-то привык отвечать клиенту иначе, кто-то не знал, что регламент поменялся полгода назад. Мы правили промпт под мнение одного и делали хуже двадцати.
Второй подход: не чинить, а собирать
Тогда мы сменили правила. Любая жалоба, любой флажок «неправильно», любой ручной откат ответа — всё это едет в одну папку. Ничего не правим в первые сутки, кроме совсем очевидных сбоев вроде «агент упал с ошибкой» или «выдал персональные данные не тому клиенту». Всё остальное копится.
Раз в неделю команда собирается на разбор. Полтора часа, ведёт технический руководитель проекта плюс кто-то со стороны заказчика — обычно старший менеджер, который знает, как должно быть на самом деле. Мы открываем папку и раскладываем случаи по кучкам:
- реальная ошибка агента: неправильно понял вопрос, вытащил не тот документ, посчитал не по той формуле;
- ошибка данных: агент честно взял то, что лежит в базе, но в базе устаревшая инструкция;
- разночтение с оператором: агент ответил корректно, но не так, как привык говорить менеджер;
- граничный случай: вопрос, под который ни промпт, ни база вообще не заточены.
Такая сортировка занимает половину встречи, зато после неё понятно, что делать. Промпт мы трогаем только под первую и третью категорию, и то с оговоркой «если таких случаев за неделю набирается заметно». База знаний обновляется под вторую. А четвёртая идёт в бэклог на отдельное проектирование — это уже не бага, это новая функция.
Как папка стала обучающей выборкой
Через пару месяцев такой работы у нас накопилось столько разобранных примеров, что папку стало неудобно листать. И тут произошла интересная штука: она сама превратилась в ту обучающую выборку, которую в проектах по обучению ИИ-агентов обычно собирают отдельным этапом за отдельные деньги.
Каждый пример там уже размечен: вопрос клиента, что ответил агент, что должно было быть, почему. Идеальная пара «вход — выход» плюс комментарий разбирающего. Мы стали использовать этот набор в трёх местах.
Во-первых, регрессионные тесты. Перед каждым релизом прогоняем агента по последним разобранным случаям и смотрим, не ломается ли то, что раньше работало. Инструмент простой: FastAPI-эндпоинт прокатывает батчем запросы и складывает ответы рядом с эталоном, Angular-панель показывает диффы. То, чего нам так не хватало на первом этапе, теперь есть само собой.
Во-вторых, few-shot примеры. Для сложных категорий вопросов мы стали подкладывать в контекст два-три реальных разобранных диалога — и качество на этих категориях подтягивалось сразу, без всякого дообучения. Самый дешёвый способ научить агента новому.
В-третьих — там, где few-shot уже не спасает и объём накопленных примеров позволяет, мы делаем полноценное дообучение на своей выборке. На GigaChat Pro это уже работает штатно. Для одного клиента мы прошли этот путь: собрали несколько сотен разобранных пар, прогнали дообучение под конкретную предметную область, откатили обратно системный промпт до короткой рамки. Агент стал стабильнее и заметно короче отвечать — нужные привычки теперь зашиты в самой модели, а не в трёхстраничной инструкции, которую он каждый раз перечитывает.
А если взять готовое
Часто спрашивают: а если взять готового Яндекс ИИ-агента из Yandex Cloud AI Studio, там же логи, метрики, интерфейс для оператора уже есть? Верно, готовая платформа снимает часть головной боли. Но красная папка и еженедельный разбор — это не про инструмент, а про процесс. Никакая платформа не сделает за вас работу старшего менеджера, который смотрит на ответ агента и говорит: «Нет, у нас так с клиентом не разговаривают».
Клиентам мы обычно советуем так. Если бизнес небольшой и агент один — берите готовое решение и заводите ту же папку в обычной таблице. Если ИИ-агентов несколько, они завязаны на 1С, CRM и внутренние регламенты, надо быстро катить изменения и держать под контролем 152-ФЗ — свой контур на GigaChat Pro или YandexGPT под управлением нашей платформы обычно окупается уже на первом году. Лучшие ИИ-агенты, которых мы видели у клиентов, отличаются не моделью под капотом, а тем, что за ними стоит команда, которая каждую неделю смотрит их ошибки.
Что изменилось в работе людей
Раньше запуск выглядел так: месяц авральных правок после релиза, потом всё как-то устаканивалось, а качество мы измеряли по количеству жалоб. Сейчас это скучнее и надёжнее. Первую неделю после запуска команда почти не трогает код — только смотрит и собирает. Со второй начинаются точечные обновления, но уже осознанные. К концу первого квартала у клиента есть не только работающий агент, но и живой архив его ошибок, из которого понятно, куда двигаться дальше.
И, пожалуй, главное. Разработка ИИ-агентов перестала быть проектом с датой сдачи. Она стала процессом, где сдача — это момент включения трафика, а дальше начинается обучение. Не в академическом смысле, а в самом бытовом: агент учится работать на этом конкретном бизнесе, а бизнес учится с ним жить. Вопрос, который стоит задать себе перед запуском своего агента, — не «какая модель лучше», а «кто у нас в понедельник открывает красную папку».
Похожие статьи
- Excel от клиента приходит каждый раз новый: как мы создали ИИ-агента для разбора выгрузок, с которыми не справилась ни одна регулярка
- Стенд вместо чужих бенчмарков: как мы проверяем ИИ-агентов для бизнеса перед сдачей
- «Хочу ИИ-агента прямо на ноутбук, как у Perplexity»: разбираемся, какие есть ИИ-агенты для ПК и что реально стоит покупать
- ИИ-агент для 1С после сентябрьских атак: как мы переписали правила доступа, не сломав рабочие сценарии





