Gemini 3 Flash Preview antwortet erst nach 40–50 Sekunden
Gemini 3 Flash PreviewGoogle AI Studioзадержка ИИ
Was bei der Latenz in Google AI Studio passiert
Für zumindest einen Teil der Google-AI-Studio-Nutzer fühlt sich Gemini 3 Flash Preview plötzlich nicht mehr besonders flash an. Seit Mittag des 23. September 2026 melden sie Antwortzeiten von 40–50 Sekunden statt der üblichen 2–3 Sekunden. In den verfügbaren Informationen gibt es keine offizielle Bestätigung von Google für einen eigenständigen Vorfall; von einer globalen Störung zu sprechen, wäre daher verfrüht.
Der Kontrast ist vor dem Hintergrund der offiziellen Google-Dokumentation zu Gemini 3 Flash Preview besonders auffällig. Das Modell befindet sich weiterhin in der öffentlichen Vorschau und wird als Option mit Fokus auf geringe Latenz und Effizienz positioniert, nicht auf maximale Tiefe beim Schlussfolgern. Verzögerungen von mehreren zehn Sekunden widersprechen dem zentralen Einsatzszenario direkt: schnellen Zyklen aus Anfrage, Prüfung und Korrektur.
Unabhängige Vergleiche zeigten zuvor ein völlig anderes Bild. In einzelnen Messungen lag die Zeit bis zum ersten Token bei etwa 0,91–0,95 Sekunden, während die Generierungsgeschwindigkeit 195,8–218 Token pro Sekunde erreichte. Ein weiterer Vergleich für Google AI Studio nannte 1,17 Sekunden Latenz und einen Durchsatz von 74 Token pro Sekunde. Es gab also schon vor den aktuellen Beschwerden eine gewisse Streuung.
Im Google-Entwicklerforum finden sich auch schwerwiegendere Fälle: Ein zahlender Tier-2-Nutzer berichtete von Antworten nach 80–356 Sekunden und häufigen 503-Fehlern. Nach seiner Aussage räumte der Google-Support ein, dass die Latenz die Zielwerte übersteige. In einem anderen Thread wurde eine starke Verlangsamung mit Kontexten von rund 50.000 Token, dem Rendering der Oberfläche und Token-Zählanfragen in Verbindung gebracht.
Daraus würde ich derzeit nicht schließen, dass sich das Modell selbst verschlechtert hat. Routing, Quoten, Infrastruktur oder die AI-Studio-Oberfläche könnten die Ursache sein, und von außen sehen diese Probleme fast gleich aus.
Warum das den schnellen Entwicklungszyklus unterbricht
Beim Prototyping verwandelt eine solche Verzögerung ein interaktives Werkzeug in eine Aufgabenwarteschlange. Wenn jede kurze Anfrage 40–50 Sekunden benötigt, verlieren Prompt-Debugging, die Prüfung strukturierter Ausgaben und der Vergleich von Varianten schnell an Nutzen.
Zuerst sollte man die Zeit bis zum ersten Token von der gesamten Generierungsdauer trennen und dann kurze mit langen Kontexten vergleichen. Fehler 503 deuten auf die Infrastrukturebene hin, während eine Verschlechterung nur bei etwa 50.000 Token eher nach Kontextskalierung oder einem Problem der Benutzeroberfläche aussieht.
Die zentrale Ungewissheit ist nicht, ob AI Studio für manche Nutzer langsam arbeitet; das zeigen die Berichte bereits. Entscheidend ist, wo die Verzögerung entsteht: innerhalb von Gemini 3 Flash Preview oder in einer Komponente darum herum.