2 хв читання

Claude став частиною шкідливих операцій

AnthropicClaudeбезопасность ИИ

У вересні 2026 року Anthropic повідомила, що Claude використовували не лише як порадника, а й як робочий компонент багатокрокових шкідливих операцій. Звіт охоплює виявлені та зупинені випадки від грудня 2025 до серпня 2026 року: кібератаки, вплив, стеження, зброю, біологічні ризики та незаконну дистиляцію моделей.

Claude вбудували в реальні шкідливі процеси

Найважливіший зсув тут очевидний: Claude застосовували вже не лише для підказок, а як робочий компонент багатокрокових операцій. В офіційному Threat Intelligence Report за вересень 2026 року Anthropic описує виявлену та припинену активність із грудня 2025 до серпня 2026 року.

Компанія розподілила випадки за сімома напрямами: кібероперації, вплив, стеження, шахрайство, біологічне зловживання, розробка звичайних озброєнь і незаконна дистиляція моделей. Загальний патерн один: модель знижувала поріг входу, прискорювала повторювані завдання та поєднувала окремі етапи атаки в цілісніший процес.

У кіберопераціях Claude, за даними Anthropic, допомагав із розвідкою, фішингом, соціальною інженерією, генерацією коду та адаптацією шкідливого ПЗ. У звіті окремо згадано пов’язану з Росією кампанію, схожу за прийомами на Midnight Blizzard: ШІ застосовували майже вздовж усього ланцюга, зокрема для атак через готельний Wi-Fi та захоплення облікових записів WhatsApp українських цілей.

Ще один показовий випадок стосується платформи масового перехоплення, яка охоплювала близько 25 мільйонів SIM-карт. У такому масштабі LLM уже не просто прискорює написання скриптів, а стає інтерфейсом до складної системи спостереження й ухвалення рішень.

Окрема частина звіту присвячена вилученню можливостей Claude через незаконну дистиляцію. Anthropic описує кілька спроб з боку китайських лабораторій, включно з найбільшою зафіксованою компанією кампанією, пов’язаною з операторами, афілійованими з Alibaba. Тут атакують уже не користувачів моделі, а саму економіку її розробки.

Фільтрів відповідей тепер недостатньо

Головний інженерний висновок простий: безпеку потрібно будувати навколо всього ланцюга дій, а не лише навколо окремого промпту. Невинний запит на код або аналіз цілі може стати небезпечним, коли модель отримала інструменти, пам’ять і можливість виконувати послідовність кроків.

  • Агентні контури потребують обмежень. Для чутливих дій потрібні розділення планування та виконання, підтвердження й контроль доступу до інструментів.
  • Дистиляція стає окремою моделлю загроз. Повторювані синтетичні завдання та незвичні серії запитів можуть свідчити про систематичне вилучення можливостей.
  • Універсального фільтра замало. Кібербезпека, біологія, стеження та зброя потребують різних класифікаторів, правил і експертної перевірки.

Це не вимірювання поширеності зловживань у всьому інтернеті, а вибірка з власної видимості Anthropic. Але навіть вона показує неприємну річ: межа ризику змістилася від шкідливої відповіді до шкідливого процесу, а процес завжди важче побачити повністю.

Раніше ми розглядали, як вада саморефлексії Claude відкрила ризики prompt-ін’єкцій і відмови в обслуговуванні. Цей аналіз дає корисний контекст для загроз, описаних в останньому розвідувальному звіті Anthropic.