3 Min. Lesezeit

Claude Fable 5.1 wird kostenlos in Arena getestet

Claude Fable 5.1Arena AIязыковые модели

Claude Fable 5.1 lässt sich bis zum 5. September um 8:00 PT kostenlos direkt im Arena Direct Mode testen. Das kurze Zeitfenster erlaubt Entwicklern, das Modell gezielt auszuwählen und mit eigenen Aufgaben zu prüfen. Danach bleibt es im Battle Mode und Agent Mode, doch die Bewertungsmethode ändert sich.

Was Arena freigeschaltet hat

Das ist der wirklich nützliche Teil: Claude Fable 5.1 kann im Direct Mode kostenlos ausgewählt und mit eigenen Prompts getestet werden. Laut der Ankündigung von Arena ist der Direktzugang bis zum 5. September um 8:00 PT geöffnet. Zum Veröffentlichungszeitpunkt ist das Angebot noch aktiv, das Zeitfenster ist jedoch sehr kurz.

Nach Ende der Aktion verschwindet das Modell nicht von der Plattform. Es bleibt im Battle Mode und Agent Mode, doch eine direkte Modellauswahl wird dann nicht mehr zugesichert. Das ist ein wesentlicher Unterschied: Direct Mode eignet sich für kontrollierte Vergleiche, während Battle Mode für den anonymen Vergleich von Antworten gedacht ist.

Arena meldet außerdem die Verfügbarkeit von Claude Fable 5.1 in Arenen für Programmierung und multimodale Aufgaben. Das kostenlose Zeitfenster ist daher nicht nur für gewöhnliche Chats interessant: Es lassen sich Codegenerierung, die Verarbeitung visueller Eingaben und das Verhalten in praktischen Szenarien prüfen.

Die Modellkarte von Anthropic liefert technischen Kontext. Claude Fable 5.1 wurde am 1. September 2026 veröffentlicht, unterstützt bis zu 1 Million Kontext-Token und eine maximale Ausgabe von 128.000 Token. Adaptives Denken ist dauerhaft aktiviert.

Zum Zeitpunkt der Ankündigung nannte Anthropic einen Preis von 10 US-Dollar pro Million Eingabe-Token und 50 US-Dollar pro Million Ausgabe-Token. Cache-Lesevorgänge wurden mit 0,25 US-Dollar pro Million Token berechnet. Ein kostenloser Durchlauf in Arena hilft bei der Bewertung der Antworten, zeigt aber nicht automatisch, ob diese API-Ökonomie gerechtfertigt ist.

Die Benchmark-Zahlen wirken beachtlich: Anthropic meldete 52,6 % bei SciBench Science 0.1 und 55,8 % bei Terminal-Bench 4.0. Arena berichtete separat, dass Fable 5.1 Max in Code Arena: WebDev mit 1765 Punkten und 77 Punkten Vorsprung den ersten Platz belegte.

Warum einige kostenlose Tage relevant sind

Das ist mehr als eine Werbeaktion: Der direkte Zugang bietet eine seltene Gelegenheit, ein teures Modell ohne Bezahlung und ohne Blindmodus zu prüfen. Ich würde zuerst die Stabilität bei langem Kontext, die Qualität komplexer Code-Überarbeitungen und die Frage untersuchen, ob adaptives Denken bei Aufgaben hilft, bei denen eine kurze Antwort Fehler leicht verdecken kann.

Entwickler erhalten vorübergehend eine Möglichkeit, das Modell mit Konkurrenzsystemen bei identischen Prompts zu vergleichen. Arena bekommt mehr praxisnahe Vergleiche, während Anthropic das Modell außerhalb eigener Demos zeigt. Nach dem Ende von Direct Mode werden solche Tests schlechter reproduzierbar, selbst wenn Battle Mode erhalten bleibt.

Ein hoher Rang und starke offizielle Werte sind gute Gründe, genauer hinzusehen, ersetzen aber keine Prüfung mit dem eigenen Aufgabensatz. Die zentrale Frage ist nicht der Rekord, sondern ob Fable 5.1 lange Arbeitsketten ohne die Anhäufung stiller Fehler bewältigt.

Wir hatten zuvor darüber berichtet, wie Anthropic nach Bedenken über stille Verschlechterungen wieder Transparenz beim Verhalten der Claude-Modelle schaffen will. Dieser Kontext ist wichtig, wenn ein neues Claude-Release über kostenlose öffentliche Tests auf Arena AI bewertet wird.