AI-агентам нужен sandbox, а не bypass по умолчанию
AI-агентыконтейнеризацияsandboxкибербезопасность
Контейнер должен ограничивать ущерб, а не создавать иллюзию
Я бы после инцидентов с дропом разделов дисков не спорил о настройке разрешений, пока агент вообще видит хост. Главный вывод здесь простой: автономность допустима только внутри среды, где ошибка не превращается в потерю раздела, секретов или системной конфигурации.
В сводке дискуссии, на которой основана эта заметка, организация и исходный документ не названы. На 6 сентября 2026 года дата самих инцидентов также не указана, поэтому я рассматриваю тему как архитектурный разбор, а не как свежий релиз. Обсуждаются два режима: онлайн-доступ после подтверждения человеком и включенный по умолчанию bypass permissions.
Сам контейнер проблему не закрывает. Нормальная граница включает запуск без root, удаление лишних Linux capabilities, файловую систему только для чтения и единственный записываемый рабочий каталог. Для усиления изоляции в сводке упомянуты gVisor, microVM, Landlock, AppArmor и механизмы уровня SELinux.
Сеть требует такого же недоверия, как диск. Исходящие соединения должны идти только к разрешенным сервисам, а учетные данные выдаваться на задачу с узкой областью действия и отзываться после нее. Отдельные идентичности для модели, контроллера агента и инструментов уменьшают радиус поражения, если один слой скомпрометирован.
Я бы отдельно проверял сокет контейнерного рантайма, родительские каталоги, примонтированные секреты и возможность расширить сетевой доступ через доступный инструмент. Именно через такие щели контейнер из песочницы быстро превращается в декоративную коробку.
Bypass полезен только для заранее ограниченных действий
Правильный баланс здесь не между полной автономностью и постоянными всплывающими вопросами. Агент может автоматически читать файлы, редактировать данные внутри рабочего каталога и выполнять обратимые команды, если эти операции физически не способны затронуть хост.
Удаление файлов, изменение разделов, доступ к секретам, системные настройки и выход за сетевой allowlist должны проходить через policy engine и подтверждение человеком. Причем разрешение лучше привязывать к конкретному действию, а не ко всей сессии: согласие на одну команду не должно становиться бессрочным пропуском.
Цена человеческого контроля очевидна: агент работает медленнее и чаще останавливается. Но широкий bypass без жесткой изоляции просто меняет удобство на увеличенный радиус аварии. Автономность начинается не с кнопки auto-allow, а с доказательства, что агенту почти нечего сломать.