Наблюдаемость не доказывает, что агент прав

Канал о системном и бизнес-анализе, продуктовом мышлении и архитектуре. Как выявлять реальные проблемы, строить работающие решения и не терять здравый смысл в IT. Все вопросы - @innokentyB

наблюдаемостьагентмониторинг

200 OK означает, что запрос завершился. Для AI-агента это почти ничего не говорит о результате.

В разборе Gallopher про наблюдаемость агентных систем разведены три уровня: инфраструктура сработала, агент принял решение, пользовательский процесс пришёл к нужному исходу. Обычный мониторинг лучше всего видит первый. Пользовательский исход часто остаётся за кадром.

Но я бы добавил одну ловушку. Можно подробно записать каждый шаг агента и всё равно проверять не то.

Если критерии оценки появились после реализации или их породил тот же агентный контур, неверная посылка может пройти через решение, результат и проверку. Трасса будет полной. Тесты будут зелёными. Пользователь получит не то, что ему было нужно.

Поэтому я забираю из статьи в TDPD не новый гейт, а отдельный контракт доказательства запуска. Для каждого значимого прогона должны быть видны:

  • версии модели, инструкций, инструментов и доступа;
  • источники контекста и путь принятого решения;
  • вызовы инструментов, разрешения и побочные эффекты;
  • проверки результата и связь с UAT.

Если обязательной части трассы нет, это не PASS, а INCOMPLETE. Для рискованного действия — остановка. При этом сама трасса не становится судьёй: мы фиксируем критерии приёмки до реализации, а UAT оставляем отдельной человеческой проверкой исходного замысла.

Исходный материал: Designing Observable AI Systems.

Читайте так же