Claude став частиною шкідливих операцій
AnthropicClaudeбезопасность ИИ
Claude вбудували в реальні шкідливі процеси
Найважливіший зсув тут очевидний: Claude застосовували вже не лише для підказок, а як робочий компонент багатокрокових операцій. В офіційному Threat Intelligence Report за вересень 2026 року Anthropic описує виявлену та припинену активність із грудня 2025 до серпня 2026 року.
Компанія розподілила випадки за сімома напрямами: кібероперації, вплив, стеження, шахрайство, біологічне зловживання, розробка звичайних озброєнь і незаконна дистиляція моделей. Загальний патерн один: модель знижувала поріг входу, прискорювала повторювані завдання та поєднувала окремі етапи атаки в цілісніший процес.
У кіберопераціях Claude, за даними Anthropic, допомагав із розвідкою, фішингом, соціальною інженерією, генерацією коду та адаптацією шкідливого ПЗ. У звіті окремо згадано пов’язану з Росією кампанію, схожу за прийомами на Midnight Blizzard: ШІ застосовували майже вздовж усього ланцюга, зокрема для атак через готельний Wi-Fi та захоплення облікових записів WhatsApp українських цілей.
Ще один показовий випадок стосується платформи масового перехоплення, яка охоплювала близько 25 мільйонів SIM-карт. У такому масштабі LLM уже не просто прискорює написання скриптів, а стає інтерфейсом до складної системи спостереження й ухвалення рішень.
Окрема частина звіту присвячена вилученню можливостей Claude через незаконну дистиляцію. Anthropic описує кілька спроб з боку китайських лабораторій, включно з найбільшою зафіксованою компанією кампанією, пов’язаною з операторами, афілійованими з Alibaba. Тут атакують уже не користувачів моделі, а саму економіку її розробки.
Фільтрів відповідей тепер недостатньо
Головний інженерний висновок простий: безпеку потрібно будувати навколо всього ланцюга дій, а не лише навколо окремого промпту. Невинний запит на код або аналіз цілі може стати небезпечним, коли модель отримала інструменти, пам’ять і можливість виконувати послідовність кроків.
- Агентні контури потребують обмежень. Для чутливих дій потрібні розділення планування та виконання, підтвердження й контроль доступу до інструментів.
- Дистиляція стає окремою моделлю загроз. Повторювані синтетичні завдання та незвичні серії запитів можуть свідчити про систематичне вилучення можливостей.
- Універсального фільтра замало. Кібербезпека, біологія, стеження та зброя потребують різних класифікаторів, правил і експертної перевірки.
Це не вимірювання поширеності зловживань у всьому інтернеті, а вибірка з власної видимості Anthropic. Але навіть вона показує неприємну річ: межа ризику змістилася від шкідливої відповіді до шкідливого процесу, а процес завжди важче побачити повністю.