Claude стал частью вредоносных операций
AnthropicClaudeбезопасность ИИ
Claude встроили в реальные вредоносные процессы
Меня здесь цепляет главный сдвиг: Claude применяли уже не только для подсказок, но и как рабочий компонент многошаговых операций. В официальном отчете Threat Intelligence Report за сентябрь 2026 года Anthropic описывает выявленную и пресеченную активность с декабря 2025-го по август 2026-го.
Компания распределила случаи по семи направлениям: кибероперации, влияние, слежка, мошенничество, биологическое злоупотребление, разработка обычных вооружений и незаконная дистилляция моделей. Общий паттерн один: модель снижала порог входа, ускоряла повторяемые задачи и связывала отдельные этапы атаки в более цельный процесс.
В кибероперациях Claude, по данным Anthropic, помогал с разведкой, фишингом, социальной инженерией, генерацией кода и адаптацией вредоносных программ. Отчет отдельно упоминает связанную с Россией кампанию, по приемам сопоставимую с Midnight Blizzard: ИИ применялся почти по всей цепочке, включая атаки через гостиничный Wi-Fi и захват учетных записей WhatsApp украинских целей.
Еще один показательный случай касается платформы массового перехвата, охватывавшей около 25 миллионов SIM-карт. На этом масштабе LLM уже не просто ускоряет написание скриптов, а становится интерфейсом к сложной системе наблюдения и принятия решений.
Отдельная линия отчета посвящена извлечению возможностей Claude через незаконную дистилляцию. Anthropic описывает несколько попыток со стороны китайских лабораторий, включая крупнейшую зафиксированную компанией кампанию, связанную с операторами, аффилированными с Alibaba. Здесь атакуют уже не пользователей модели, а саму экономику ее разработки.
Фильтров на ответы теперь недостаточно
Главный инженерный вывод простой: безопасность нужно строить вокруг всей цепочки действий, а не только вокруг отдельного промпта. Безобидный запрос на код или анализ цели может стать опасным, когда модель получила инструменты, память и возможность выполнять последовательность шагов.
- Агентные контуры требуют ограничений. Для чувствительных действий нужны разделение планирования и исполнения, подтверждения и контроль доступа к инструментам.
- Дистилляция становится отдельной моделью угроз. Повторяющиеся синтетические задания и необычные серии запросов могут указывать на систематическое извлечение возможностей.
- Универсального фильтра мало. Кибербезопасность, биология, слежка и оружие требуют разных классификаторов, правил и экспертной проверки.
Это не измерение распространенности злоупотреблений во всем интернете, а выборка из собственной видимости Anthropic. Но даже такая выборка показывает неприятную вещь: граница риска сместилась от вредного ответа к вредному процессу, а процесс всегда труднее заметить целиком.