200 OK означает, что запрос завершился. Для AI-агента это почти ничего не говорит о результате.
В разборе Gallopher про наблюдаемость агентных систем разведены три уровня: инфраструктура сработала, агент принял решение, пользовательский процесс пришёл к нужному исходу. Обычный мониторинг лучше всего видит первый. Пользовательский исход часто остаётся за кадром.
Но я бы добавил одну ловушку. Можно подробно записать каждый шаг агента и всё равно проверять не то.
Если критерии оценки появились после реализации или их породил тот же агентный контур, неверная посылка может пройти через решение, результат и проверку. Трасса будет полной. Тесты будут зелёными. Пользователь получит не то, что ему было нужно.
Поэтому я забираю из статьи в TDPD не новый гейт, а отдельный контракт доказательства запуска. Для каждого значимого прогона должны быть видны:
- версии модели, инструкций, инструментов и доступа;
- источники контекста и путь принятого решения;
- вызовы инструментов, разрешения и побочные эффекты;
- проверки результата и связь с UAT.
Если обязательной части трассы нет, это не PASS, а INCOMPLETE. Для рискованного действия — остановка. При этом сама трасса не становится судьёй: мы фиксируем критерии приёмки до реализации, а UAT оставляем отдельной человеческой проверкой исходного замысла.
Исходный материал: Designing Observable AI Systems.
