Новость

Мониторинг AI-агентов в мультиоблачных средах через AgentCore Observability

По данным AWS, нативный мониторинг AI-агентов через Amazon Bedrock AgentCore Observability теперь можно подключить не только в периметре AWS — его протянули до on-prem, Google Cloud и Microsoft Azure.

Мониторинг AI-агентов в мультиоблачных средах через AgentCore Observability

Раньше встроенный трейсинг закрывал только рантайм внутри AWS, и для остального приходилось городить самописные коннекторы. Сейчас AWS выкатил готовую обвязку через AWS Distro for OpenTelemetry — для мультиоблачных стеков это меняет правила игры.

Как развязали узел с внешними средами

AgentCore Observability входит в платформу Amazon Bedrock AgentCore и держит под контролем трейсинг, мониторинг и аналитику для агентов, собранных на Strands Agents, LangGraph или CrewAI. До апдейта нативная поддержка работала только для деплоя в среде AgentCore runtime на AWS — то есть в своей песочнице. Всё, что разъезжалось по контейнерам Amazon EKS, ECS, лямбдам, on-prem или чужим облакам, оставалось в слепой зоне: телеметрия не доезжала до дашборда, и проблемные ответы проходили мимо.

Решение — пакет aws-opentelemetry-distro, который запускается в процессе с приложением агента. Он автоматически инструментирует фреймворк, снимает спаны по семантическим конвенциям генеративного AI и экспортирует телеметрию прямо в CloudWatch через OTLP-эндпоинт с SigV4-аутентификацией по IAM. Под капотом связка из четырёх элементов: CloudWatch как фундамент для сбора и хранения, AgentCore Observability для AI-специфичных дашбордов, ADOT для кросс-платформенной инструментации, IAM для безопасной аутентификации между внешней средой и AWS.

Что ловим на практике

Для команды, которая собирает стек с агентами и считает лимиты по бюджету, появляются конкретные параметры под контролем. Можно отслеживать галлюцинации, мониторить вредные или оффтоп-ответы, замерять токен-расход на каждую генерацию и аудировать, какие тулзы агент вызывает в цепочке рассуждений. И всё это сводится в один дашборд — независимо от того, где физически живёт сам агент.

Принципиальный момент: observability становится фундаментом ответственного AI, как только агенты выходят за периметр одного облака. Раньше проблемные выходы из внешних сред уходили в никуда — теперь у них есть маршрут в централизованный мониторинг, и это меняет саму философию продакшн-стеков.

Перед включением: шаг, который легко профукать

AWS отдельно отмечает: перед стартом нужно один раз включить Transaction Search на аккаунт, иначе телеметрия не дойдёт до дашборда, даже если пайплайн выглядит рабочим. Однократная настройка, но пропуск даёт ложное ощущение, что всё ок, а данные молча теряются.

Ещё нюанс: схема упирается в валидные IAM-креды и SigV4 на стороне не-AWS среды. Это не zero-touch — это итерация вида «прописать креденшалы, отправить тестовый спан, проверить end-to-end». В командах, где сетевики и DevOps живут в разных чатах, это потенциальная точка трения, которую стоит закрыть заранее. Тем, кто только формирует экспертизу и решает, с чего заходить в такой стек, пригодится разбор по выбору подходящей программы подготовки — там видно, по каким вводным вообще планировать найм и какие компетенции закладывать на старте.