Claude Sonnet 5.5: eine Million Token günstiger
Claude Sonnet 5.5AnthropicLLM
Was Anthropic genau veröffentlicht hat
Interessant ist hier weniger die Versionsnummer als die Kombination praktischer Eigenschaften, die Anthropic in Sonnet 5.5 bündelt. Auf der offiziellen Seite zu Claude Sonnet 5.5 und in der Modellübersicht der Claude Platform bezeichnet das Unternehmen es als primäres Sonnet für die API und als Balance aus Geschwindigkeit und Intelligenz. Es ist keine experimentelle Demonstration mehr, sondern ein produktiver Einstiegspunkt in die Modellfamilie.
Das Kontextfenster umfasst eine Million Token, die maximale Ausgabe erreicht 128.000 Token. Das Modell unterstützt adaptives Denken; die Standardstufe für den Aufwand ist auf high gesetzt. In der API lautet die Kennung claude-sonnet-5-5. Damit wird eine Migration ausdrücklich vorgenommen, statt ein Modell stillschweigend unter einem bisherigen Namen zu ersetzen.
Zum Start lag der Grundpreis bei 2 $ pro Million Eingabe-Token und 10 $ pro Million Ausgabe-Token. Die Batch API gewährt in beide Richtungen 50 Prozent Rabatt. Beim Prompt Caching kostet das Lesen 0,20 $ pro Million Token, ein regulärer Schreibvorgang 2,50 $ und ein Schreibvorgang mit einstündiger TTL 4 $.
Anthropic erklärt, dass eine typische Arbeitslast bis zu 30 Prozent weniger kosten kann als mit Sonnet 5, obwohl beide Modelle dieselben Grundtarife haben. Der wesentliche Effekt soll also nicht aus einer neuen Zahl in der Preisliste kommen, sondern aus effizienterer Ausführung und Abrechnung.
Wo das Release die Lage tatsächlich verändert
Für API-Teams ist dies ein echtes Upgrade und nicht bloß eine Umordnung im Modellkatalog. Ein Kontext von einer Million Token ist für Agenten, große Codebasen und lange Dokumentketten interessant; 128.000 Ausgabe-Token nehmen zugleich einen Teil der Beschränkungen bei der Erzeugung umfangreicher Artefakte. Ein hohes Limit garantiert allerdings nicht, dass das Modell den gesamten Kontext überall gleich zuverlässig nutzt.
Ich würde zuerst drei Punkte prüfen:
- wie präzise Fakten aus unterschiedlichen Teilen eines langen Prompts erhalten bleiben;
- was bei effort high mit Latenz und Tokenverbrauch geschieht;
- ob die versprochene Ersparnis in realen Agentenzyklen mit Tools und Cache bestehen bleibt.
Am meisten profitieren Szenarien, in denen Kontextkapazität und die Wiederverwendung von Prompts wichtiger sind als der niedrigste Preis pro Anfrage. Das bekannte Risiko bleibt: Ein leistungsfähiges Modell mit hohem Aufwand kann Einsparungen bei der Eingabe durch lange Begründungen und Ausgaben in eine hohe Rechnung verwandeln. Bei Sonnet 5.5 geht es daher nicht um die Million Token allein, sondern darum, wie berechenbar diese Kapazität unter Last arbeitet.