3 Min. Lesezeit

Claude Opus 5.5 erklärt Fehler klarer, liebt aber TLDR

Claude Opus 5.5Anthropicпромпт-инжиниринг

Nutzerberichten zufolge erklärt Claude Opus 5.5 Fehler deutlich klarer als Opus 5, während das Wochenlimit großzügig wirken kann. Anthropic nennt ein Kontextfenster von einer Million Tokens und bis zu 128.000 Output-Tokens. Die häufigen TLDR-Zusammenfassungen bleiben jedoch als Stilproblem deutlich erkennbar.

Die wichtigste Änderung zeigt sich nicht nur in Benchmarks

Interessant ist hier nicht der nächste Punktezuwachs, sondern etwas Bodenständigeres: Laut einem Nutzerfeedback erklärt Claude Opus 5.5 Fehler klarer. Wo Opus 5 mehrfach mit vager, beinahe „kosmischer“ Sprache auf einen Bug hindeutete und den Kern nicht vermittelte, konnte die neue Version das Problem verständlich formulieren.

Auch das offizielle Bild deutet auf ein großes Update hin. In der Claude-Platform-Dokumentation und den Release Notes von Anthropic wird das Modell als Werkzeug für langfristige agentische Aufgaben in der Softwareentwicklung und Wissensarbeit beschrieben. Genannt werden ein Kontextfenster von einer Million Tokens, maximal 128.000 Output-Tokens sowie dauerhaft aktiviertes adaptives Denken, das über die Einstellung effort gesteuert wird.

In den veröffentlichten Anthropic-Materialien erreicht Opus 5.5 bei Terminal-Bench 4.0 66,4 % gegenüber 52,3 % bei Opus 5. Für GDPval-AA v2.1 werden 1846 Elo gegenüber 1708 genannt. Das sind keine direkten Tests der Sprachqualität, aber die Werte passen gut zu der Annahme, dass das Modell komplexe Anweisungen und Handlungsketten zuverlässiger beibehält.

Zum Zeitpunkt der Ankündigung lag der Preis bei 4 US-Dollar pro Million Input-Tokens und 20 US-Dollar pro Million Output-Tokens. Ein anderer Nutzer schreibt außerdem, dass er dem Wochenlimit nicht einmal nahekommt. Diese Erfahrung lässt sich nicht verallgemeinern: Der Verbrauch hängt stark von Kontextlänge, Arbeitsmodus und der Zahl agentischer Iterationen ab.

Mehr Klarheit, aber die Stilgewohnheiten bleiben

Für die praktische Arbeit ist das eine echte Verbesserung: Eine verständliche Erklärung eines Bugs ist mehr wert als ein eleganter Hinweis darauf. Wenn ein Modell die Ursache einer Störung schneller eingrenzt und in normaler Sprache benennt, sind weniger Rückfragen nötig und wichtige Details gehen seltener hinter selbstbewusster Wortfülle verloren.

Doch es bleibt ein vertrauter stilistischer Preis. In der Diskussion bezeichnet ein anderer Nutzer TLDR als eines der häufigsten Wörter in Texten aktueller Opus-Versionen. Das ist eine anekdotische Beobachtung und keine gemessene Modelleigenschaft, doch für Prompt Engineers ist das Signal klar: Das Antwortformat sollte ausdrücklich vorgegeben werden, besonders wenn eine automatische Zusammenfassung die erwartete Struktur stört.

Ich würde zuerst nicht die Schönheit einer einzelnen Antwort prüfen, sondern die Stabilität über eine lange Aufgabenserie: Bleibt das Modell klar, wiederholt es keine Zusammenfassungen und versteckt es keine Details hinter TLDR? Die zentrale Frage bei Opus 5.5 lautet nicht mehr, ob es denken kann, sondern wie diszipliniert es dieses Denken zeigt.

Wir hatten bereits über Anthropics Kehrtwende bei den versteckten Qualitätsabstufungen von Claude-Anfragen berichtet und darüber, was sie über Transparenz im Modellverhalten verriet. Die Debatte um Opus 5.5 zeigt ebenfalls, warum Änderungen der Ausgabequalität kritisch geprüft werden müssen, statt ihnen blind zu vertrauen.