Codex nicht für Lieder, sondern für langwierige Agentenarbeit
codexai-agentsmodel-behavior
Codex ist nicht langsam, es spielt nur ein anderes Spiel
Hier wirkt Codex nicht defekt, sondern auf Aufgaben zugeschnitten, bei denen es besser ist, eine Aktion noch einmal zu bestätigen, als stillschweigend Chaos anzurichten. OpenAIs Dokumentation beschreibt einen Auto-Review-Modus: Das Modell übergibt die geplante Aktion und den frischen Kontext einem Genehmigungs-Subagenten, der risikoarme Schritte und mit ausreichender Autorisierung auch einige riskantere automatisch genehmigen kann.
Bei einer kreativen Aufgabe wird das zur Bürokratie. Ein Nutzer bittet um ein Lied und erhält fünf klärende Fragen, ein Konzept, einen Schreibplan und Genehmigungsanfragen nach jedem Schritt. Formal macht das Modell den Prozess sorgfältiger, aber das Ergebnis erscheint nicht dort, wo ein schneller ästhetischer Wurf nötig ist.
Und hier ist der Kontrast interessanter als die Beschwerde selbst. Andere Diskussionsteilnehmer schreiben, dass Codex bei ihnen einen halben Tag oder länger läuft, und ein Nutzer beschreibt eine Woche autonomer Arbeit und tausende Experimente. Ich würde das nicht als verifizierten Benchmark ausgeben: Es ist Nutzererfahrung, kein reproduzierbarer Test. Aber die Richtung deckt sich damit, wie OpenAI Codex positioniert: sichere Standards, isolierte Umgebung, lange agentische Zyklen, Arbeit mit Code und Forschungsaufgaben.
Das Problem ist also nicht, dass das Modell mit Text nicht umgehen kann. Das Problem ist, dass sein Verhalten auf Planung, Aktion, Überprüfung und Risikokontrolle optimiert ist. Für ein Lied klingt das nach Pedanterie. Für Experimente ähnelt es bereits einer nützlichen Disziplin.
Wo dieser Modellcharakter wirklich wertvoll ist
Die Hauptschlussfolgerung ist einfach: Bewerten Sie Codex nicht als universellen Autor, sondern als agentisches System für Aufgaben mit überprüfbaren Schritten. Programmierung, Forschung, Hypothesentests, Experimentstarts und schrittweise Verfeinerung profitieren weit mehr von dieser Vorsicht, als sie darunter leiden.
Beim offenen Schreiben ist es umgekehrt. Oft gibt es kein eindeutiges Erfolgskriterium, dafür aber Stil, Tempo, mutige Formulierungen und die Bereitschaft, sofort einen vollständigen Entwurf zu liefern. Wenn das Modell stattdessen ein Genehmigungsprotokoll aufbaut, unterbricht es den Fluss. Nicht weil es dumm ist, sondern weil es versucht, dort zuverlässig zu sein, wo Geschmack erwartet wird.
Für mich ist in dieser Geschichte nicht der Streit wichtig, welches Modell die besseren Lieder schreibt. Die Eingabedaten geben keine faire Rangliste zwischen Gemini, Claude, Grok, Fable oder anderen her. Aber sie zeigen deutlich die technische Weggabelung: Dieselbe Vorsicht kann störende Reibung im Text und wertvoller Schutz bei autonomer Arbeit sein.
Die gefährlichste Schlussfolgerung wäre, Codex ein schlechtes Modell zu nennen. Eine genauere ist langweiliger, aber nützlicher: Agentisches Verhalten ohne das richtige Skript sieht schnell nach Bürokratie mit GPU aus.