Агентная архитектура AWS для интеллектуального анализа видео по запросу
Amazon Web Services опубликовала практическую схему агентной архитектуры для видеоаналитики, которая отвечает на естественно-языковые вопросы к загруженным роликам за секунды.

Загрузите 90-минутную запись совещания и спросите «какие решения приняли» — агент сам выберет сервисы AWS и соберёт связный ответ. Для команд, у которых часы записей совещаний, обследований и съёмки с камер копятся без разбора, это рабочий сдвиг в экономике внимания.
Архитектура: один агент вместо пайплайна
Ключевой приём — Strands Agents SDK, который собирает единого AI-агента, маршрутизирующего запросы между Amazon Bedrock, Amazon Rekognition и Amazon Transcribe. Отдельные пайплайны под каждый тип вопроса больше не нужны: маршрутизация решается во время запроса, без жёстко зашитых правил в коде приложения.
Запрос про речь — Transcribe. Про внешность или совпадение лиц — Rekognition. Повторные вопросы по уже разобранному ролику отдаются из кэша. По данным AWS, для ранее проанализированного контента ответ приходит менее чем за секунду; первичная обработка нового видео занимает 5–10 минут в зависимости от длины и состава сервисов.
Что показал пилот
Решение прошло обкатку через AWS Professional Services у крупной медиакомпании. Консультанты получили инструмент, который заходит в записи discovery-сессий и достаёт оттуда дизайн-решения, action items и позиции стейкхолдеров — параметры, которые обычно теряются в часах видео.
По внутреннему сравнению заказчика, ручной разбор сократился приблизительно на 80% на выборке из более чем 200 многочасовых записей. Важная оговорка от AWS: это оценка самого клиента по нормо-часам аналитиков на запись, независимой верификации не проводилось.
Что делать и где держать лимит
Полная реализация выложена в companion-репозитории — можно поднять локально и прогнать на своих роликах. Перед тем как тащить в продакшн, пройдитесь по трём точкам:
- Определите классы запросов под вашу задачу. Если нужна только транскрипция или только детекция лиц, узкоспециализированные модели окажутся дешевле по токенам и быстрее по итерациям.
- Заложите бюджет на первичную генерацию. 5–10 минут на ролик — это не realtime для стриминга, и в первые минуты после загрузки ответа вы не получите.
- Проверьте кейс на повторных вопросах. Именно здесь секундный отклик из кэша превращается в реальную экономию для команды.
Итерация вышла короткой: вместо месяцев на отдельные ML-пайплайны — один агент, который сам зовёт нужные сервисы по типу запроса. Для разработчиков, строящих прикладной ИИ на AWS, это готовый референс по работе с видео и текстом в одной связке.