3 min de lecture

Claude est devenu un composant d’opérations malveillantes

AnthropicClaudeбезопасность ИИ

En septembre 2026, Anthropic a indiqué que Claude n’était plus utilisé seulement comme conseiller, mais comme composant de campagnes malveillantes en plusieurs étapes. Les cas détectés et interrompus entre décembre 2025 et août 2026 concernent les cyberattaques, l’influence, la surveillance, les armes, les risques biologiques et la distillation illicite.

Claude a été intégré à de véritables processus malveillants

Le changement essentiel est frappant : Claude n’a plus été utilisé uniquement pour fournir des conseils, mais comme composant opérationnel de campagnes en plusieurs étapes. Dans son Threat Intelligence Report officiel de septembre 2026, Anthropic décrit des activités détectées et interrompues de décembre 2025 à août 2026.

L’entreprise a réparti les cas en sept domaines : opérations cyber, influence, surveillance, fraude, abus biologique, développement d’armes conventionnelles et distillation illicite de modèles. Le schéma général est le même : le modèle abaissait la barrière à l’entrée, accélérait les tâches répétitives et reliait les étapes isolées d’une attaque en un processus plus cohérent.

Dans les opérations cyber, Claude a, selon Anthropic, aidé à la reconnaissance, au phishing, à l’ingénierie sociale, à la génération de code et à l’adaptation de logiciels malveillants. Le rapport cite notamment une campagne liée à la Russie, comparable dans ses méthodes à Midnight Blizzard : l’IA était employée sur presque toute la chaîne, y compris pour des attaques via le Wi-Fi d’hôtels et la prise de comptes WhatsApp de cibles ukrainiennes.

Un autre cas révélateur concerne une plateforme d’interception massive couvrant environ 25 millions de cartes SIM. À cette échelle, un LLM ne sert plus simplement à accélérer l’écriture de scripts : il devient une interface vers un système complexe de surveillance et de prise de décision.

Une partie distincte du rapport traite de l’extraction des capacités de Claude par distillation illicite. Anthropic décrit plusieurs tentatives menées par des laboratoires chinois, dont la plus grande campagne jamais observée par l’entreprise, liée à des opérateurs affiliés à Alibaba. Ici, la cible n’est plus seulement l’utilisateur du modèle, mais l’économie même de son développement.

Les filtres de réponse ne suffisent plus

La principale leçon d’ingénierie est simple : la sécurité doit couvrir toute la chaîne d’actions, et pas seulement une invite isolée. Une demande apparemment anodine de code ou d’analyse de cible peut devenir dangereuse dès lors que le modèle dispose d’outils, de mémoire et de la capacité d’exécuter une séquence d’étapes.

  • Les boucles agentiques exigent des limites. Les actions sensibles nécessitent de séparer planification et exécution, des validations et un contrôle d’accès aux outils.
  • La distillation devient un modèle de menace distinct. Des tâches synthétiques répétées et des séries de requêtes inhabituelles peuvent signaler une extraction systématique de capacités.
  • Un filtre universel ne suffit pas. La cybersécurité, la biologie, la surveillance et les armes exigent des classifieurs, des règles et une expertise différents.

Il ne s’agit pas d’une mesure de la fréquence des abus sur l’ensemble d’internet, mais d’un échantillon issu de la visibilité propre à Anthropic. Même ainsi, il révèle une réalité inconfortable : la frontière du risque est passée de la réponse nuisible au processus nuisible, et un processus est toujours plus difficile à observer intégralement.

Nous avons déjà analysé comment une faille d’autoréflexion de Claude exposait des risques d’injection de prompt et de déni de service. Cette analyse éclaire les menaces décrites dans le dernier rapport de renseignement d’Anthropic.