Codex не для песен, а для долгой агентной работы
codexai-agentsmodel-behavior
Codex не тормозит, он просто играет в другую игру
Codex здесь выглядит не сломанным, а заточенным под задачи, где лучше лишний раз согласовать действие, чем тихо натворить мусора. В документации OpenAI по Codex описан Auto-review mode: модель передает планируемое действие и свежий контекст approval-субагенту, который может автоматически одобрять низкорисковые шаги и часть более рискованных действий при достаточной авторизации.
На творческой задаче это превращается в бюрократию. Пользователь просит написать песню, а получает пять уточняющих вопросов, замысел, план написания и просьбы об апруве после каждого шага. Формально модель делает процесс аккуратнее, но результат не появляется там, где нужен быстрый эстетический бросок.
И вот тут контраст интереснее самой жалобы. Другие участники обсуждения пишут, что Codex у них работает по полдня и дольше, а один пользователь описывает неделю автономной работы и тысячи экспериментов. Я бы не выдавал это за проверенный бенчмарк: это пользовательский опыт, а не воспроизводимый тест. Но направление совпадает с тем, как OpenAI позиционирует Codex: безопасные дефолты, изолированная среда, длинные агентные циклы, работа с кодом и исследовательскими задачами.
То есть проблема не в том, что модель не умеет текст. Проблема в том, что ее поведение оптимизировано под план, действия, проверку и контроль рисков. Для песни это звучит как занудство. Для экспериментов это уже похоже на полезную дисциплину.
Где такой характер модели реально полезен
Главный вывод простой: Codex стоит оценивать не как универсального автора, а как агентную систему для задач с проверяемыми шагами. Кодинг, research, перебор гипотез, запуск экспериментов и постепенное уточнение решения получают от такой осторожности больше пользы, чем вреда.
В open-ended письме все наоборот. Там часто нет однозначного критерия успеха, зато есть стиль, темп, смелость формулировки и готовность сразу дать цельный черновик. Если модель вместо этого строит протокол согласований, она ломает поток. Не потому что глупая, а потому что пытается быть надежной там, где от нее ждут вкуса.
Мне в этой истории важен не спор, какая модель лучше пишет песни. Входные данные не дают честного рейтинга между Gemini, Claude, Grok, Fable или другими моделями. Зато они хорошо показывают инженерную развилку: одна и та же осторожность может быть раздражающим трением в тексте и ценным предохранителем в автономной работе.
Самый опасный вывод был бы назвать Codex плохой моделью. Более точный вывод скучнее, но полезнее: агентность без правильного сценария быстро выглядит как канцелярия с GPU.