2 мин чтения

Claude стал частью вредоносных операций

AnthropicClaudeбезопасность ИИ

В сентябре 2026 года Anthropic сообщила, что Claude использовали не только как советчика, но и как компонент многошаговых вредоносных операций. Отчет охватывает выявленные и пресеченные случаи с декабря 2025-го по август 2026-го в семи областях, включая кибератаки, влияние, слежку, оружие, биологические риски и незаконную дистилляцию моделей.

Claude встроили в реальные вредоносные процессы

Меня здесь цепляет главный сдвиг: Claude применяли уже не только для подсказок, но и как рабочий компонент многошаговых операций. В официальном отчете Threat Intelligence Report за сентябрь 2026 года Anthropic описывает выявленную и пресеченную активность с декабря 2025-го по август 2026-го.

Компания распределила случаи по семи направлениям: кибероперации, влияние, слежка, мошенничество, биологическое злоупотребление, разработка обычных вооружений и незаконная дистилляция моделей. Общий паттерн один: модель снижала порог входа, ускоряла повторяемые задачи и связывала отдельные этапы атаки в более цельный процесс.

В кибероперациях Claude, по данным Anthropic, помогал с разведкой, фишингом, социальной инженерией, генерацией кода и адаптацией вредоносных программ. Отчет отдельно упоминает связанную с Россией кампанию, по приемам сопоставимую с Midnight Blizzard: ИИ применялся почти по всей цепочке, включая атаки через гостиничный Wi-Fi и захват учетных записей WhatsApp украинских целей.

Еще один показательный случай касается платформы массового перехвата, охватывавшей около 25 миллионов SIM-карт. На этом масштабе LLM уже не просто ускоряет написание скриптов, а становится интерфейсом к сложной системе наблюдения и принятия решений.

Отдельная линия отчета посвящена извлечению возможностей Claude через незаконную дистилляцию. Anthropic описывает несколько попыток со стороны китайских лабораторий, включая крупнейшую зафиксированную компанией кампанию, связанную с операторами, аффилированными с Alibaba. Здесь атакуют уже не пользователей модели, а саму экономику ее разработки.

Фильтров на ответы теперь недостаточно

Главный инженерный вывод простой: безопасность нужно строить вокруг всей цепочки действий, а не только вокруг отдельного промпта. Безобидный запрос на код или анализ цели может стать опасным, когда модель получила инструменты, память и возможность выполнять последовательность шагов.

  • Агентные контуры требуют ограничений. Для чувствительных действий нужны разделение планирования и исполнения, подтверждения и контроль доступа к инструментам.
  • Дистилляция становится отдельной моделью угроз. Повторяющиеся синтетические задания и необычные серии запросов могут указывать на систематическое извлечение возможностей.
  • Универсального фильтра мало. Кибербезопасность, биология, слежка и оружие требуют разных классификаторов, правил и экспертной проверки.

Это не измерение распространенности злоупотреблений во всем интернете, а выборка из собственной видимости Anthropic. Но даже такая выборка показывает неприятную вещь: граница риска сместилась от вредного ответа к вредному процессу, а процесс всегда труднее заметить целиком.

Ранее мы разбирали, как уязвимость Claude к саморефлексии создавала риски промпт-инъекций и отказа в обслуживании. Этот материал дает полезный контекст к угрозам из нового разведывательного отчета Anthropic.