Claude Opus 5.5 erklärt Fehler klarer, liebt aber TLDR
Claude Opus 5.5Anthropicпромпт-инжиниринг
Die wichtigste Änderung zeigt sich nicht nur in Benchmarks
Interessant ist hier nicht der nächste Punktezuwachs, sondern etwas Bodenständigeres: Laut einem Nutzerfeedback erklärt Claude Opus 5.5 Fehler klarer. Wo Opus 5 mehrfach mit vager, beinahe „kosmischer“ Sprache auf einen Bug hindeutete und den Kern nicht vermittelte, konnte die neue Version das Problem verständlich formulieren.
Auch das offizielle Bild deutet auf ein großes Update hin. In der Claude-Platform-Dokumentation und den Release Notes von Anthropic wird das Modell als Werkzeug für langfristige agentische Aufgaben in der Softwareentwicklung und Wissensarbeit beschrieben. Genannt werden ein Kontextfenster von einer Million Tokens, maximal 128.000 Output-Tokens sowie dauerhaft aktiviertes adaptives Denken, das über die Einstellung effort gesteuert wird.
In den veröffentlichten Anthropic-Materialien erreicht Opus 5.5 bei Terminal-Bench 4.0 66,4 % gegenüber 52,3 % bei Opus 5. Für GDPval-AA v2.1 werden 1846 Elo gegenüber 1708 genannt. Das sind keine direkten Tests der Sprachqualität, aber die Werte passen gut zu der Annahme, dass das Modell komplexe Anweisungen und Handlungsketten zuverlässiger beibehält.
Zum Zeitpunkt der Ankündigung lag der Preis bei 4 US-Dollar pro Million Input-Tokens und 20 US-Dollar pro Million Output-Tokens. Ein anderer Nutzer schreibt außerdem, dass er dem Wochenlimit nicht einmal nahekommt. Diese Erfahrung lässt sich nicht verallgemeinern: Der Verbrauch hängt stark von Kontextlänge, Arbeitsmodus und der Zahl agentischer Iterationen ab.
Mehr Klarheit, aber die Stilgewohnheiten bleiben
Für die praktische Arbeit ist das eine echte Verbesserung: Eine verständliche Erklärung eines Bugs ist mehr wert als ein eleganter Hinweis darauf. Wenn ein Modell die Ursache einer Störung schneller eingrenzt und in normaler Sprache benennt, sind weniger Rückfragen nötig und wichtige Details gehen seltener hinter selbstbewusster Wortfülle verloren.
Doch es bleibt ein vertrauter stilistischer Preis. In der Diskussion bezeichnet ein anderer Nutzer TLDR als eines der häufigsten Wörter in Texten aktueller Opus-Versionen. Das ist eine anekdotische Beobachtung und keine gemessene Modelleigenschaft, doch für Prompt Engineers ist das Signal klar: Das Antwortformat sollte ausdrücklich vorgegeben werden, besonders wenn eine automatische Zusammenfassung die erwartete Struktur stört.
Ich würde zuerst nicht die Schönheit einer einzelnen Antwort prüfen, sondern die Stabilität über eine lange Aufgabenserie: Bleibt das Modell klar, wiederholt es keine Zusammenfassungen und versteckt es keine Details hinter TLDR? Die zentrale Frage bei Opus 5.5 lautet nicht mehr, ob es denken kann, sondern wie diszipliniert es dieses Denken zeigt.