3 min de lectura

Claude pasó a formar parte de operaciones maliciosas

AnthropicClaudeбезопасность ИИ

En septiembre de 2026, Anthropic informó que Claude se utilizó no solo como asesor, sino como parte operativa de campañas maliciosas de varios pasos. Los casos detectados y bloqueados entre diciembre de 2025 y agosto de 2026 incluyen ciberataques, influencia, vigilancia, armas, riesgos biológicos y destilación ilícita de modelos.

Claude se integró en procesos maliciosos reales

El cambio principal resulta llamativo: Claude ya no se empleó solo para recibir sugerencias, sino como componente operativo de campañas de varios pasos. En su Threat Intelligence Report oficial de septiembre de 2026, Anthropic describe actividad detectada e interrumpida entre diciembre de 2025 y agosto de 2026.

La empresa agrupó los casos en siete áreas: ciberoperaciones, influencia, vigilancia, fraude, uso indebido biológico, desarrollo de armas convencionales y destilación ilícita de modelos. El patrón común es claro: el modelo reducía la barrera de entrada, aceleraba tareas repetitivas y conectaba fases aisladas de un ataque en un proceso más coherente.

En ciberoperaciones, según Anthropic, Claude ayudó con reconocimiento, phishing, ingeniería social, generación de código y adaptación de malware. El informe menciona específicamente una campaña vinculada a Rusia, comparable en sus técnicas con Midnight Blizzard: la IA se utilizó en casi toda la cadena, incluidos ataques mediante Wi-Fi de hoteles y la toma de cuentas de WhatsApp de objetivos ucranianos.

Otro caso ilustrativo se refiere a una plataforma de interceptación masiva que cubría unos 25 millones de tarjetas SIM. A esta escala, un LLM ya no solo acelera la escritura de scripts: se convierte en una interfaz para un sistema complejo de vigilancia y toma de decisiones.

Otra línea del informe trata sobre la extracción de capacidades de Claude mediante destilación ilícita. Anthropic describe varios intentos de laboratorios chinos, incluida la mayor campaña registrada por la empresa, vinculada a operadores afiliados con Alibaba. En este caso, el objetivo ya no son solo los usuarios del modelo, sino la propia economía de su desarrollo.

Los filtros de respuestas ya no bastan

La principal conclusión de ingeniería es sencilla: la seguridad debe diseñarse en torno a toda la cadena de acciones, no únicamente a un prompt individual. Una solicitud aparentemente inocua de código o análisis de objetivos puede volverse peligrosa cuando el modelo dispone de herramientas, memoria y capacidad de ejecutar una secuencia de pasos.

  • Los circuitos agénticos necesitan límites. Las acciones sensibles requieren separar planificación y ejecución, confirmaciones y controles de acceso a las herramientas.
  • La destilación se está convirtiendo en un modelo de amenaza propio. Tareas sintéticas repetidas y secuencias inusuales de solicitudes pueden señalar una extracción sistemática de capacidades.
  • Un filtro universal no es suficiente. La ciberseguridad, la biología, la vigilancia y las armas requieren clasificadores, reglas y revisión experta diferentes.

No es una medición de la prevalencia del abuso en toda internet, sino una muestra de la visibilidad propia de Anthropic. Aun así, revela algo incómodo: la frontera del riesgo se desplazó de una respuesta dañina a un proceso dañino, y un proceso siempre es más difícil de detectar por completo.

Anteriormente analizamos cómo una falla de autorreflexión de Claude expuso riesgos de inyección de prompts y denegación de servicio. Ese análisis aporta contexto útil para las amenazas descritas en el último informe de inteligencia de Anthropic.