3 min de lectura

Un vídeo de recetas no debe tener acceso a la tarjeta

промпт-инъекцияИИ-агентыфинансовая безопасность

Un agente de IA que recibe un vídeo de recetas y paga el pedido por sí solo abre la puerta a la inyección multimodal de prompts. StakeBench detectó fallos en 3.168 ejecuciones atacadas. El contenido multimedia no fiable no debe conectarse directamente a pagos sin aislamiento, esquemas estrictos y confirmación humana.

Un vídeo no debe convertirse en una orden de pago

No daría a un agente el flujo de «ve una receta y compra los ingredientes» sin una frontera estricta entre interpretar contenido y ejecutar una transacción. Un vídeo, artículo, captura de pantalla o respuesta de una herramienta externa son datos no fiables: pueden incluir una instrucción que el modelo confunda con la continuación de su tarea.

Por eso el escenario promocional comentado, en el que se envía a un agente un vídeo de recetas y este paga con tarjeta y organiza la entrega, no parece una demostración cómoda, sino una superficie de ataque ya preparada. El comentario por sí mismo no demuestra una intrusión real ni la existencia de pedidos en una cuenta. Sin embargo, la arquitectura descrita es peligrosa incluso sin esa prueba.

La guía de OpenAI sobre seguridad de agentes y la especificación del modelo recomiendan aislar las entradas no fiables, transmitirlas mediante campos estructurados y no mezclarlas directamente con las instrucciones del desarrollador. Para las acciones de herramientas, especialmente las que afectan a datos financieros, se recomienda una aprobación humana explícita. La tarjeta del sistema de GPT-5 también menciona comprobaciones de inyección de prompts en llamadas a herramientas y navegación.

La magnitud del problema también se aprecia en los benchmarks. StakeBench abarcó 3.168 ejecuciones de agentes web atacadas, y ningún objetivo de ataque fue bloqueado de forma fiable. FinVault incluye 963 pruebas de agentes financieros con inyecciones de prompts, jailbreaks y requisitos de cumplimiento. En septiembre de 2026, ya no es un caso extremo exótico, sino una amenaza básica para los sistemas agénticos.

La arquitectura tendrá que limitar la autonomía

La conclusión es sencilla: la seguridad no puede delegarse en el propio modelo. Si el texto extraído de un vídeo puede formar directamente los parámetros de una compra, una sola inyección exitosa puede saltar del contenido al circuito de pagos.

Separaría el proceso, como mínimo, en extracción de la lista, validación con un esquema fijo y confirmación independiente de la operación. La herramienta necesita permisos limitados, las acciones permitidas deben definirse mediante enumeraciones y el importe, la dirección y el contenido del pedido no pueden llegar silenciosamente desde el material multimedia. Cada cambio de prompt o modelo exige nuevas pruebas adversariales.

Esto reduce la apariencia de «autonomía total», pero conserva lo esencial: un vídeo puede proponer datos, no obtener permiso para disponer de la tarjeta. Mientras un agente lea Internet de forma abierta y gaste dinero sin confirmación, su comodidad seguirá siendo otra forma de vulnerabilidad.

Ya analizamos cómo la inyección de prompts puede alterar la automatización con IA y llevar a los agentes a comportamientos inseguros. La misma debilidad resulta especialmente costosa cuando un agente puede seguir instrucciones de vídeo y realizar compras.