2 мин чтения

Видео с рецептом не должно получать доступ к карте

промпт-инъекцияИИ-агентыфинансовая безопасность

Сценарий, где ИИ-агент получает видео с рецептом и сам оплачивает заказ, создает риск мультимодальной промпт-инъекции. StakeBench выявил уязвимости в 3 168 атакованных запусках. Недоверенный медиаконтент нельзя напрямую связывать с платежами без изоляции, строгой схемы, узких прав и явного подтверждения человеком.

Видео не должно становиться платежной командой

Я бы не давал агенту цепочку «увидел рецепт, купил продукты» без жесткой границы между распознаванием контента и выполнением транзакции. Ролик, статья, скриншот или ответ внешнего инструмента являются недоверенными данными: внутри может оказаться инструкция, которую модель ошибочно примет за продолжение задачи.

Именно поэтому рекламный сценарий из обсуждения, где агенту отправляют видео с рецептом, а он платит картой и оформляет доставку, звучит не как удобная демонстрация, а как готовая поверхность атаки. Сам комментарий не доказывает реальный взлом или наличие заказов в аккаунте. Но описанная архитектура опасна даже без такого доказательства.

В руководстве OpenAI по безопасности агентов и в спецификации модели недоверенные входы рекомендуется изолировать, передавать через структурированные поля и не подмешивать напрямую в инструкции разработчика. Для действий инструментов, особенно операций с финансовыми данными, рекомендуется явное одобрение человеком. В системной карточке GPT-5 отдельно упомянуты проверки промпт-инъекций при вызове инструментов и браузинге.

Масштаб проблемы виден и по бенчмаркам. StakeBench охватил 3 168 атакованных запусков веб-агентов, причем ни одна цель атаки не была надежно отражена. FinVault включает 963 теста финансовых агентов с промпт-инъекциями, джейлбрейками и требованиями комплаенса. На сентябрь 2026 года это уже не экзотический крайний случай, а базовая угроза для агентных систем.

Автономность придется ограничивать архитектурой

Вывод простой: безопасность здесь нельзя делегировать самой модели. Если текст, извлеченный из видео, способен напрямую сформировать параметры покупки, то одна удачная инъекция перескакивает из контента в платежный контур.

Я бы разделял такой процесс минимум на извлечение списка, проверку по фиксированной схеме и отдельное подтверждение операции. Инструменту нужны узкие права, допустимые действия должны задаваться перечислениями, а сумма, адрес и состав заказа не могут незаметно приходить из медиаконтента. Каждое изменение промпта или модели требует повторных атакующих тестов.

Это снижает эффект «полной автономности», зато сохраняет главное: видео может предложить данные, но не получить право распоряжаться картой. Пока агент одновременно читает произвольный интернет и тратит деньги без подтверждения, его удобство остается другой формой уязвимости.

Ранее мы разбирали, как промпт-инъекция может нарушить автоматизацию на базе ИИ и подтолкнуть агентов к небезопасным действиям. Эта же слабость становится особенно дорогой, когда агент способен выполнять инструкции из видео и совершать покупки.