3 Min. Lesezeit

Codex nicht für Lieder, sondern für langwierige Agentenarbeit

codexai-agentsmodel-behavior

Codex zeigte eine Schieflage: Für ein Lied stellte er fünf Fragen und verlangte nach jedem Schritt eine Genehmigung, während bei Rechercheaufgaben von halbtägiger oder längerer autonomer Arbeit berichtet wird. Das passt zu OpenAIs Design: automatische Überprüfung, sichere Standards und agentische Ausführung eignen sich besser für Code und Experimente als für offene Lyrik.

Codex ist nicht langsam, es spielt nur ein anderes Spiel

Hier wirkt Codex nicht defekt, sondern auf Aufgaben zugeschnitten, bei denen es besser ist, eine Aktion noch einmal zu bestätigen, als stillschweigend Chaos anzurichten. OpenAIs Dokumentation beschreibt einen Auto-Review-Modus: Das Modell übergibt die geplante Aktion und den frischen Kontext einem Genehmigungs-Subagenten, der risikoarme Schritte und mit ausreichender Autorisierung auch einige riskantere automatisch genehmigen kann.

Bei einer kreativen Aufgabe wird das zur Bürokratie. Ein Nutzer bittet um ein Lied und erhält fünf klärende Fragen, ein Konzept, einen Schreibplan und Genehmigungsanfragen nach jedem Schritt. Formal macht das Modell den Prozess sorgfältiger, aber das Ergebnis erscheint nicht dort, wo ein schneller ästhetischer Wurf nötig ist.

Und hier ist der Kontrast interessanter als die Beschwerde selbst. Andere Diskussionsteilnehmer schreiben, dass Codex bei ihnen einen halben Tag oder länger läuft, und ein Nutzer beschreibt eine Woche autonomer Arbeit und tausende Experimente. Ich würde das nicht als verifizierten Benchmark ausgeben: Es ist Nutzererfahrung, kein reproduzierbarer Test. Aber die Richtung deckt sich damit, wie OpenAI Codex positioniert: sichere Standards, isolierte Umgebung, lange agentische Zyklen, Arbeit mit Code und Forschungsaufgaben.

Das Problem ist also nicht, dass das Modell mit Text nicht umgehen kann. Das Problem ist, dass sein Verhalten auf Planung, Aktion, Überprüfung und Risikokontrolle optimiert ist. Für ein Lied klingt das nach Pedanterie. Für Experimente ähnelt es bereits einer nützlichen Disziplin.

Wo dieser Modellcharakter wirklich wertvoll ist

Die Hauptschlussfolgerung ist einfach: Bewerten Sie Codex nicht als universellen Autor, sondern als agentisches System für Aufgaben mit überprüfbaren Schritten. Programmierung, Forschung, Hypothesentests, Experimentstarts und schrittweise Verfeinerung profitieren weit mehr von dieser Vorsicht, als sie darunter leiden.

Beim offenen Schreiben ist es umgekehrt. Oft gibt es kein eindeutiges Erfolgskriterium, dafür aber Stil, Tempo, mutige Formulierungen und die Bereitschaft, sofort einen vollständigen Entwurf zu liefern. Wenn das Modell stattdessen ein Genehmigungsprotokoll aufbaut, unterbricht es den Fluss. Nicht weil es dumm ist, sondern weil es versucht, dort zuverlässig zu sein, wo Geschmack erwartet wird.

Für mich ist in dieser Geschichte nicht der Streit wichtig, welches Modell die besseren Lieder schreibt. Die Eingabedaten geben keine faire Rangliste zwischen Gemini, Claude, Grok, Fable oder anderen her. Aber sie zeigen deutlich die technische Weggabelung: Dieselbe Vorsicht kann störende Reibung im Text und wertvoller Schutz bei autonomer Arbeit sein.

Die gefährlichste Schlussfolgerung wäre, Codex ein schlechtes Modell zu nennen. Eine genauere ist langweiliger, aber nützlicher: Agentisches Verhalten ohne das richtige Skript sieht schnell nach Bürokratie mit GPU aus.

Zuvor berichteten wir, wie Anthropic die versteckte Herabstufung von Anfragen in Claude rückgängig machte und nach dem Skandal für Transparenz sorgte. Diese Änderung führte zu übergroßer Vorsicht des Modells, sodass es sich weigerte, Lieder zu generieren und nur noch für wissenschaftliche Aufgaben nützlich blieb.