AI-агент может выдать правильный финальный ответ опасным путём: вызвать лишний инструмент, прочитать слишком много данных, повторить действие или потратить больше нормы.
Поэтому в продакшене нужен полный путь выполнения, а не только uptime и последняя реплика.
Свяжите один запуск сквозным trace ID
Присвойте входящему запросу ID и передавайте его через модель, поиск, инструменты, согласования и результат. Трасса должна показывать порядок, длительность, статус и исполнителя.
OpenTelemetry описывает traces, metrics и events как взаимодополняющие сигналы. Полное содержимое может раскрывать данные, поэтому промпты и результаты храните только при обоснованной цели, правах и сроке хранения.
Логируйте каждое решение об инструменте
Записывайте предложенный инструмент, аргументы, использованные права, согласование, результат и retry. Отделяйте предложение модели от системного действия.
OWASP предупреждает об excessive agency. Применяйте минимальные права из руководства по prompt injection.
- actor и request ID
- версия модели и процесса
- инструмент и проверенные аргументы
- решение политики или человека
- результат, ошибка и повторы
- изменённая запись во внешней системе
Измеряйте качество после запуска
Считайте принятые результаты, существенные исправления, эскалации, отмены и ложные действия. Проверяйте выборку обычных успешных запусков, а не только ошибки.
Повторяйте golden dataset из предзапусковых тестов и сравнивайте модель, промпт, язык и версию workflow.
Ограничивайте задержку и стоимость
Измеряйте время до полезного ответа, полную длительность, токены, внешние API и ручную проверку. Ставьте лимиты на запуск и день.
Ограничьте число шагов, токены, повторы и параллельные вызовы. Следите за стоимостью принятого результата, а не одного вызова.
Делайте алерты исполнимыми
Сигналы нужны для решения: попытка лишнего доступа, ошибка схемы, повтор действия, рост ошибок или стоимости, очередь и падение качества.
У алерта должны быть владелец, уровень, ожидаемое время реакции, runbook и подавление дублей.
Сохраните fallback и ручной стоп
Fallback может быть детерминированным процессом, read-only режимом, задачей человеку или прошлой версией. Переход нужно протестировать.
Важные действия останавливаются внешним механизмом. Human-in-the-loop включает согласование, отмену, rollback и аудит.
Разбирайте инциденты и near miss
Сохраните трассу, конфигурацию, входы, инструменты и последствия. Определите источник: данные, модель, промпт, права, интеграция, мониторинг или процесс.
Добавьте вывод как тест, изменение контроля и задачу владельцу.
Как я контролирую publishing-agent
В моём конвейере модель не получает общую способность «опубликовать». Процесс создаёт черновик, сравнивает 21 поле, проверяет языковые страницы и ссылки и только затем выполняет полный перевод в published.
Трасса разделяет текст, загрузку обложки, сохранённую запись и публичную страницу. Любое расхождение останавливает процесс. Поэтому один работающий URL ещё не доказывает корректность всей цепочки.
Вопросы и ответы
Что контролировать первым?
Бизнес-результат, действия инструментов, ошибки, задержку, стоимость и ручные отмены.
Нужно ли хранить промпты?
Только при необходимости и законном основании. Минимизируйте содержимое, доступ и срок хранения.
Как обнаружить цикл?
Ограничьте шаги, повторные вызовы, время и бюджет; при достижении границы остановите запуск.
Достаточно ли dashboard?
Нет. Нужны владелец, порог, канал уведомления и проверенный порядок реакции.
Как часто делать evals?
По выборке постоянно, по расписанию и после существенных изменений.
Операционный лист контроля
До согласования занесите каждый контроль в таблицу: владелец, доказательство, порог и дата следующей проверки. Фраза «контролировать качество» не исполнима. Правило «операционный владелец каждый понедельник проверяет долю существенных исправлений и ставит процесс на паузу выше согласованного порога» можно проверить.
Свяжите контроль с последствием для бизнеса. Если ошибка схемы может повредить карточку клиента, опишите containment и reconciliation. Если всплеск стоимости объясняется сезонным объёмом, задайте контекст, защищающий от ложной эскалации.
Версионируйте промпты, схемы, политики, инструменты и внешние зависимости. Результат без конфигурации нельзя воспроизвести. У исключений должны быть причина, владелец и срок окончания, иначе временный обход станет невидимой постоянной политикой.
Отрепетируйте человеческий путь. Назначенный владелец должен найти доказательства, остановить или ограничить workflow, включить fallback и объяснить состояние без просьбы к самому AI диагностировать себя.
