2 Min. Lesezeit

Codex 6 Sol: Ultra-Reasoning kommt in die CLI

Codex 6 SolCodex CLIreasoning models

Codex 6 Sol bietet in der CLI jetzt wählbare Reasoning-Tiefen von Low bis Ultra, während Medium der Standard bleibt. Ultra ist relevant, weil es nicht nur mehr Reasoning-Aufwand liefert, sondern Aufgaben automatisch delegiert. Dadurch entsteht für komplexe Programmierarbeit möglicherweise ein interner Multi-Agenten-Prozess.

Ultra in der CLI ist mehr als verstärktes Reasoning

Entscheidend ist hier nicht bloß ein weiterer Schalter, sondern ein Wandel der Arbeitsmechanik: Codex 6 Sol bietet sechs Reasoning-Stufen direkt in der CLI. In der offiziellen OpenAI-Dokumentation zu GPT-6 Sol werden Low, Medium, High, Extra high, Max und Ultra genannt. Mit Stand vom 23. September 2026 ist Medium als Standardwert angegeben.

Die OpenAI-Dokumentation zur Reasoning-API trennt den Reasoning-Modus ausdrücklich vom Reasoning-Aufwand. Die Modellauswahl allein bedeutet also nicht automatisch maximale Verarbeitungstiefe; ohne explizite Einstellung bleibt das System auf einem mittleren Niveau. Für Konfiguration und Reproduzierbarkeit ist das wesentlich: Dieselbe Anfrage an dasselbe Modell kann mit einem anderen Reasoning-Budget laufen.

Am interessantesten wird es bei Ultra. Diese Stufe wird als maximales Reasoning mit automatischer Aufgabendelegation beschrieben. Es geht damit nicht mehr nur um eine längere interne Suche nach einer Antwort. Vom Prinzip her ähnelt es eher einem eingebauten Multi-Agenten-Kreislauf, in dem das Hauptmodell Teile der Arbeit auf Unteraufgaben verteilen kann.

Das erste Signal für die Funktion kam aus Nutzerbeobachtungen zu Codex CLI; die Dokumentation erklärt, was hinter dem neuen Interface-Punkt steckt. Details der Orchestrierung legt sie jedoch nicht offen: wie viele Unteraufgaben erzeugt werden, wie Kontext zwischen ihnen weitergegeben wird und wie das Endergebnis zusammengesetzt wird.

Bei komplexen Aufgaben verändert sich der Arbeitsablauf selbst

Die praktische Verschiebung ist einfach: Entwickler wählen nun nicht nur das Modell, sondern auch die Form der Rechenarbeit für eine Aufgabe. Medium wirkt wie der Basismodus für alltäglichen Code, während High, Max und Ultra für schwierigere Fehlersuche und mehrstufige Repository-Arbeit gedacht sind.

Ich würde zunächst weniger auf den Namen Ultra als auf die Kosten der Koordination schauen. Automatische Delegation kann die Zerlegung verbessern, bringt aber auch doppelte Arbeit, höheren Kontextverbrauch und Fehler beim Zusammenführen von Teilergebnissen mit sich. Ohne transparente Nachverfolgung ist schwer zu erkennen, ob das Modell die Aufgabe sinnvoll aufgeteilt oder lediglich mehr Rechenaufwand erzeugt hat.

Das ist kein leeres kosmetisches Update: Reasoning wird schrittweise Teil der normalen Entwickleroberfläche statt eines versteckten API-Parameters. Der tatsächliche Wert von Ultra wird jedoch nicht durch maximale Reasoning-Tiefe bestimmt, sondern dadurch, wie zuverlässig Codex seine eigenen Unteraufgaben koordiniert. Genau dort verläuft die Grenze zwischen einem nützlichen agentischen Modus und einer teuren Illusion von Betriebsamkeit.

Wir haben zuvor den Rollout von Codex in ChatGPT für Android und seine Bedeutung für verteilte Entwicklungsteams behandelt. Dieser Kontext hilft einzuordnen, wie ein neuer Reasoning-Modus die praktische Rolle von Codex in Engineering-Workflows verändern könnte.