Как измерить эффективность ИИ-агента после запуска

Саммари: Агент, отлично прошедший тесты, в реальной эксплуатации работает заметно хуже — разрыв между лабораторными бенчмарками и продакшеном в 2026 году оценивают в 37%. Разбираем, какие метрики смотреть после запуска и почему самые популярные из них вводят в заблуждение.

Почему офлайн-тестов недостаточно

Главный аргумент в пользу измерения в проде — сам масштаб расхождения: в 2026 году компании фиксируют существенный разрыв в 37% между результатами на лабораторных бенчмарках и реальной работой в эксплуатации, что делает мониторинг в продакшене обязательным.

Есть и более коварная деталь: стабильность результата на повторах. Агенты, показывающие 60% успешности с одной попытки, падают до 25%, если запустить ту же задачу восемь раза.

Метрика номер один: доля выполненных задач

Инженерная команда Anthropic формулирует подход к оценке агентов через один вопрос: действительно ли агент завершил задачу пользователя — не сгенерировал ли что-то правдоподобное и не вызвал ли правильный API, а закрыл ли человек свою задачу.

Сложность здесь в определении «завершено»: для агента, работающего с кодом, это может значить, что код собрался и прошёл тесты, а для агента поддержки — что проблема клиента реально решена, а не просто принята в работу, и ошибка в определении искажает все производные метрики. Ориентир для продакшена — от 65% выполненных задач, ниже этого пользователи быстро теряют доверие к системе; средний показатель выполнения задач в 2026 году составляет 82% против 65% в 2024-м.

Формулировка критерия успеха тоже имеет значение: «агент должен помогать пользователю» бесполезно, а «агент решает проблему клиента по счёту без эскалации менее чем за 3 минуты» — проверяемо.

Метрика, которая обманывает: deflection rate

Здесь стоит быть внимательным, особенно при сравнении вендоров. Deflection rate — доля обращений, не дошедших до живого оператора, включая просмотры справочных статей и просто брошенные диалоги — был стандартной метрикой эпохи чат-ботов: он говорит о снижении объёма нагрузки и ничего не говорит о результате для клиента, и платформа может иметь 90% deflection при 40% реального решения задач, если клиентов просто перенаправляют, а не помогают им.

Метрика-проверка на честность — доля переоткрытых обращений: процент «решённых» диалогов, после которых клиент возвращается с той же проблемой в течение 24–48 часов. Высокий процент решений вместе с высоким процентом переоткрытий — это тот же самый deflection, просто в красивой упаковке. Соответственно, снижение доли повторных обращений после запуска — сильное свидетельство того, что агент действительно решает проблемы, а не создаёт видимость решения.

Поведенческие метрики: как ловить тихую деградацию

Отдельный класс метрик отслеживает не результат, а сам путь агента к нему: меняется ли его логика рассуждений от недели к неделе, растёт ли число шагов, смещается ли выбор инструментов — эти сигналы ловят тихую деградацию до того, как она станет инцидентом в продакшене.

Масштаб проблемы дрейфа стоит понимать: при уходе агента от стабильного поведения доля успешно выполненных задач падает с 87,3% до 50,6%, при этом число вмешательств человека растёт более чем втрое, точность ответов — с 91,2% до 68,5%, а число человеческих вмешательств вырастает с 0,31 до 0,98 на задачу.

Именно поэтому мы в AllSee считаем метрику не только при сдаче, но и в процессе эксплуатации продукта. Качество может незаметно проседать со временем под влиянием факторов, которых не было в тестовых данных: новые сегменты пользователей, непредусмотренные сценарии обращений. Подход к постановке и отслеживанию метрик на всех этапах проекта — на allsee.team.

Ритм измерений: что смотреть ежедневно, еженедельно и ежемесячно

Практичная схема разносит метрики по трём горизонтам: ежедневно — телеметрия системы (всплески задержек, каскадные отказы API, дрейф выходных данных), еженедельно — результаты рабочего процесса (доля выполненных задач, нагрузка на проверку, частота ручных переопределений), ежемесячно — влияние на бизнес (стоимость результата, выручка, эффективность процесса).

Важный принцип, который часто упускают: каждую бизнес-метрику стоит парой сопровождать защитной метрикой — например, сокращать время обработки, одновременно следя, чтобы доля эскалаций оставалась стабильной. Без этого легко улучшить одну цифру за счёт скрытого ухудшения другой.

Автоматика плюс человек: пропорция, которая работает

Полностью автоматизировать оценку не выходит: даже лучшая автоматизация выигрывает от периодической ручной проверки, потому что человек замечает нюансы — несоответствие тона, вводящие в заблуждение формулировки, этические промахи, — которые модели и скрипты пропускают. Многие организации приходят к пропорции примерно 80% автоматической оценки и 20% экспертной проверки — это сохраняет масштабируемость, не теряя суждения и подотчёт.

Итог

Измерение эффективности агента после запуска сводится к трём вещам: точно определить, что считается выполненной задачей (и не подменять это метрикой вроде deflection); отслеживать не только результат, но и поведение — путь рассуждения, число шагов, выбор инструментов, чтобы ловить деградацию заранее; и сохранять человеческую проверку на выборке, потому что автоматика не видит того, что видно человеку. Метрики без системы вокруг них — просто числа на дашборде.

Источники

Создайте новое будущее с нашими решениями

Похожие статьи
Показать еще