2 мин чтения

AI-агентам нужен sandbox, а не bypass по умолчанию

AI-агентыконтейнеризацияsandboxкибербезопасность

Инциденты с удалением разделов диска показывают: AI-агентам нельзя выдавать широкие права по умолчанию. Безопасная архитектура объединяет изолированный sandbox, минимальные привилегии, ограниченный сетевой доступ и подтверждение человека для разрушительных действий. Режим bypass допустим только в жестко ограниченной среде с обратимыми операциями.

Контейнер должен ограничивать ущерб, а не создавать иллюзию

Я бы после инцидентов с дропом разделов дисков не спорил о настройке разрешений, пока агент вообще видит хост. Главный вывод здесь простой: автономность допустима только внутри среды, где ошибка не превращается в потерю раздела, секретов или системной конфигурации.

В сводке дискуссии, на которой основана эта заметка, организация и исходный документ не названы. На 6 сентября 2026 года дата самих инцидентов также не указана, поэтому я рассматриваю тему как архитектурный разбор, а не как свежий релиз. Обсуждаются два режима: онлайн-доступ после подтверждения человеком и включенный по умолчанию bypass permissions.

Сам контейнер проблему не закрывает. Нормальная граница включает запуск без root, удаление лишних Linux capabilities, файловую систему только для чтения и единственный записываемый рабочий каталог. Для усиления изоляции в сводке упомянуты gVisor, microVM, Landlock, AppArmor и механизмы уровня SELinux.

Сеть требует такого же недоверия, как диск. Исходящие соединения должны идти только к разрешенным сервисам, а учетные данные выдаваться на задачу с узкой областью действия и отзываться после нее. Отдельные идентичности для модели, контроллера агента и инструментов уменьшают радиус поражения, если один слой скомпрометирован.

Я бы отдельно проверял сокет контейнерного рантайма, родительские каталоги, примонтированные секреты и возможность расширить сетевой доступ через доступный инструмент. Именно через такие щели контейнер из песочницы быстро превращается в декоративную коробку.

Bypass полезен только для заранее ограниченных действий

Правильный баланс здесь не между полной автономностью и постоянными всплывающими вопросами. Агент может автоматически читать файлы, редактировать данные внутри рабочего каталога и выполнять обратимые команды, если эти операции физически не способны затронуть хост.

Удаление файлов, изменение разделов, доступ к секретам, системные настройки и выход за сетевой allowlist должны проходить через policy engine и подтверждение человеком. Причем разрешение лучше привязывать к конкретному действию, а не ко всей сессии: согласие на одну команду не должно становиться бессрочным пропуском.

Цена человеческого контроля очевидна: агент работает медленнее и чаще останавливается. Но широкий bypass без жесткой изоляции просто меняет удобство на увеличенный радиус аварии. Автономность начинается не с кнопки auto-allow, а с доказательства, что агенту почти нечего сломать.

Ранее мы разбирали Pydantic Monty — безопасный Python-интерпретатор для запуска кода, сгенерированного LLM, без контейнеров. Такой подход позволяет сопоставить изоляцию среды с рисками обхода разрешений у AI-агентов.