Claude wurde Teil schädlicher Operationen
AnthropicClaudeбезопасность ИИ
Claude wurde in reale schädliche Abläufe eingebunden
Der zentrale Wandel ist bemerkenswert: Claude wurde nicht mehr nur für Hinweise genutzt, sondern als operativer Baustein mehrstufiger Kampagnen. Im offiziellen Threat Intelligence Report vom September 2026 beschreibt Anthropic erkannte und unterbundene Aktivitäten von Dezember 2025 bis August 2026.
Das Unternehmen ordnete die Fälle sieben Bereichen zu: Cyberoperationen, Einflussnahme, Überwachung, Betrug, biologischer Missbrauch, Entwicklung konventioneller Waffen und illegale Modelldestillation. Das gemeinsame Muster ist klar: Das Modell senkte die Einstiegshürde, beschleunigte wiederkehrende Aufgaben und verband einzelne Angriffsphasen zu einem geschlosseneren Prozess.
Bei Cyberoperationen half Claude laut Anthropic bei Aufklärung, Phishing, Social Engineering, Codegenerierung und der Anpassung von Schadsoftware. Der Bericht nennt ausdrücklich eine Russland zugeschriebene Kampagne, deren Methoden Midnight Blizzard ähnelten: KI wurde fast entlang der gesamten Kette eingesetzt, einschließlich Angriffen über Hotel-WLAN und der Übernahme von WhatsApp-Konten ukrainischer Ziele.
Ein weiterer aufschlussreicher Fall betrifft eine Plattform zur Massenüberwachung, die rund 25 Millionen SIM-Karten umfasste. In dieser Größenordnung beschleunigt ein LLM nicht mehr nur das Schreiben von Skripten, sondern wird zur Schnittstelle für ein komplexes Überwachungs- und Entscheidungssystem.
Ein eigener Abschnitt des Berichts behandelt die Extraktion von Claude-Fähigkeiten durch illegale Destillation. Anthropic beschreibt mehrere Versuche chinesischer Labore, darunter die größte vom Unternehmen dokumentierte Kampagne, die mit Alibaba verbundenen Akteuren zugeschrieben wird. Hier wird nicht mehr nur der Nutzer des Modells angegriffen, sondern die Ökonomie seiner Entwicklung selbst.
Antwortfilter reichen nicht mehr aus
Die wichtigste technische Schlussfolgerung ist einfach: Sicherheit muss die gesamte Handlungskette absichern, nicht nur einen einzelnen Prompt. Eine harmlose Anfrage nach Code oder Zielanalyse kann gefährlich werden, sobald ein Modell Werkzeuge, Speicher und die Möglichkeit besitzt, eine Abfolge von Schritten auszuführen.
- Agentische Abläufe brauchen Grenzen. Sensible Aktionen erfordern eine Trennung von Planung und Ausführung, Bestätigungen sowie Zugriffskontrollen für Werkzeuge.
- Destillation wird zu einem eigenen Bedrohungsmodell. Wiederholte synthetische Aufgaben und ungewöhnliche Anfrageserien können auf eine systematische Extraktion von Fähigkeiten hindeuten.
- Ein universeller Filter genügt nicht. Cybersicherheit, Biologie, Überwachung und Waffen erfordern unterschiedliche Klassifikatoren, Regeln und fachkundige Prüfung.
Dies ist keine Messung der Missbrauchshäufigkeit im gesamten Internet, sondern eine Stichprobe aus der eigenen Sichtbarkeit von Anthropic. Doch selbst sie zeigt eine unbequeme Tatsache: Die Risikogrenze hat sich von einer schädlichen Antwort zu einem schädlichen Prozess verschoben, und Prozesse sind stets schwerer vollständig zu erkennen.