Skip to main content
AI-агентыавтоматизация разработкиSRE

Автономные кодинг-агенты пока рано пускать в прод

Обсуждение вокруг Claude Code и Codex снова показало простую вещь: полная автономия кодинг-агентов в проде пока опасна. Для AI automation это важно потому, что без жесткой верификации агент легко пишет лишний функционал, плодит фиктивные задачи и трогает то, что уже работает.

Технический контекст

Я внимательно смотрю на такие эксперименты, потому что это уже не игрушка, а вполне реальная тема для AI implementation в разработке и эксплуатации. И вот мой вывод после десятков похожих кейсов: посадить Claude Code или Codex в отдельный контейнер и назвать его «проактивным SRE» звучит дерзко, но на практике агент очень быстро начинает делать не то.

В обсуждении люди описали знакомый паттерн. Один агент ревьювит код, другой сам его «чинит», а на выходе появляется ворох лишних юзкейсов, фоллоу-ап задач и изменений вне скоупа. Я такое тоже видел: модель не просто ошибается, она уверенно расширяет задачу, будто ей скучно работать по ТЗ.

Технически здесь сходятся сразу три сбоя. Первый, action bias: агенту психологически ближе что-то поменять, чем честно сказать «ничего делать не надо». Второй, context drift: на длинной цепочке шагов он теряет границы задачи и начинает оптимизировать локально, ломая систему глобально. Третий, обычные галлюцинации: несуществующие API, странные зависимости, фиксы ради фиксов.

Поэтому идея «пусть сам мониторит, сам чинит, сам пишет команде» без внешнего харнеса мне не нравится. Если и запускать такое, то только в песочнице, с отдельной ролью, минимальными правами, откатом по git snapshot, обязательными тестами и вторым проверяющим контуром. Иначе это не SRE, а генератор дорогого шума.

Влияние на бизнес и автоматизацию

Для микросервисов и микро-SaaS вывод очень приземленный. Выигрывают не те, кто дал агенту полную свободу, а те, кто нарезал ему узкий периметр: регистрация инцидентов, создание задач, черновики PR, первичная диагностика.

Проигрывают команды, которые путают AI integration с полной заменой инженерной дисциплины. Лишний код потом кто-то вычищает руками, а цена «автономии» внезапно превращается в часы ревью, регрессии и риск для продакшена.

Мы в Nahornyi AI Lab как раз такие вещи и собираем для клиентов: не магию, а рабочую AI automation с верификацией, ролями и понятными стоп-кранами. Если у вас агент уже начал плодить шум вместо пользы, давайте посмотрим на процесс трезво и соберем такую AI solutions architecture, где он действительно экономит время, а не создает новые инциденты.

Мы ранее разбирали, как параллельные агенты Claude Code отлавливают состояния гонки при ревью PR. Этот опыт тесно связан с текущим обсуждением того, к чему приводит автономная работа Claude Code в роли SRE и почему она генерирует ложные задачи.

Поделиться статьёй