Видео с рецептом не должно получать доступ к карте
промпт-инъекцияИИ-агентыфинансовая безопасность
Видео не должно становиться платежной командой
Я бы не давал агенту цепочку «увидел рецепт, купил продукты» без жесткой границы между распознаванием контента и выполнением транзакции. Ролик, статья, скриншот или ответ внешнего инструмента являются недоверенными данными: внутри может оказаться инструкция, которую модель ошибочно примет за продолжение задачи.
Именно поэтому рекламный сценарий из обсуждения, где агенту отправляют видео с рецептом, а он платит картой и оформляет доставку, звучит не как удобная демонстрация, а как готовая поверхность атаки. Сам комментарий не доказывает реальный взлом или наличие заказов в аккаунте. Но описанная архитектура опасна даже без такого доказательства.
В руководстве OpenAI по безопасности агентов и в спецификации модели недоверенные входы рекомендуется изолировать, передавать через структурированные поля и не подмешивать напрямую в инструкции разработчика. Для действий инструментов, особенно операций с финансовыми данными, рекомендуется явное одобрение человеком. В системной карточке GPT-5 отдельно упомянуты проверки промпт-инъекций при вызове инструментов и браузинге.
Масштаб проблемы виден и по бенчмаркам. StakeBench охватил 3 168 атакованных запусков веб-агентов, причем ни одна цель атаки не была надежно отражена. FinVault включает 963 теста финансовых агентов с промпт-инъекциями, джейлбрейками и требованиями комплаенса. На сентябрь 2026 года это уже не экзотический крайний случай, а базовая угроза для агентных систем.
Автономность придется ограничивать архитектурой
Вывод простой: безопасность здесь нельзя делегировать самой модели. Если текст, извлеченный из видео, способен напрямую сформировать параметры покупки, то одна удачная инъекция перескакивает из контента в платежный контур.
Я бы разделял такой процесс минимум на извлечение списка, проверку по фиксированной схеме и отдельное подтверждение операции. Инструменту нужны узкие права, допустимые действия должны задаваться перечислениями, а сумма, адрес и состав заказа не могут незаметно приходить из медиаконтента. Каждое изменение промпта или модели требует повторных атакующих тестов.
Это снижает эффект «полной автономности», зато сохраняет главное: видео может предложить данные, но не получить право распоряжаться картой. Пока агент одновременно читает произвольный интернет и тратит деньги без подтверждения, его удобство остается другой формой уязвимости.