3 Min. Lesezeit

Gemini 3 Flash Preview antwortet erst nach 40–50 Sekunden

Gemini 3 Flash PreviewGoogle AI Studioзадержка ИИ

Am 23. September 2026 berichteten Nutzer, dass Gemini 3 Flash Preview in Google AI Studio statt der üblichen 2–3 Sekunden 40–50 Sekunden für Antworten benötigt. Das ist für ein auf geringe Latenz ausgelegtes Modell erheblich, auch wenn Google bislang keinen separaten Vorfall bestätigt hat.

Was bei der Latenz in Google AI Studio passiert

Für zumindest einen Teil der Google-AI-Studio-Nutzer fühlt sich Gemini 3 Flash Preview plötzlich nicht mehr besonders flash an. Seit Mittag des 23. September 2026 melden sie Antwortzeiten von 40–50 Sekunden statt der üblichen 2–3 Sekunden. In den verfügbaren Informationen gibt es keine offizielle Bestätigung von Google für einen eigenständigen Vorfall; von einer globalen Störung zu sprechen, wäre daher verfrüht.

Der Kontrast ist vor dem Hintergrund der offiziellen Google-Dokumentation zu Gemini 3 Flash Preview besonders auffällig. Das Modell befindet sich weiterhin in der öffentlichen Vorschau und wird als Option mit Fokus auf geringe Latenz und Effizienz positioniert, nicht auf maximale Tiefe beim Schlussfolgern. Verzögerungen von mehreren zehn Sekunden widersprechen dem zentralen Einsatzszenario direkt: schnellen Zyklen aus Anfrage, Prüfung und Korrektur.

Unabhängige Vergleiche zeigten zuvor ein völlig anderes Bild. In einzelnen Messungen lag die Zeit bis zum ersten Token bei etwa 0,91–0,95 Sekunden, während die Generierungsgeschwindigkeit 195,8–218 Token pro Sekunde erreichte. Ein weiterer Vergleich für Google AI Studio nannte 1,17 Sekunden Latenz und einen Durchsatz von 74 Token pro Sekunde. Es gab also schon vor den aktuellen Beschwerden eine gewisse Streuung.

Im Google-Entwicklerforum finden sich auch schwerwiegendere Fälle: Ein zahlender Tier-2-Nutzer berichtete von Antworten nach 80–356 Sekunden und häufigen 503-Fehlern. Nach seiner Aussage räumte der Google-Support ein, dass die Latenz die Zielwerte übersteige. In einem anderen Thread wurde eine starke Verlangsamung mit Kontexten von rund 50.000 Token, dem Rendering der Oberfläche und Token-Zählanfragen in Verbindung gebracht.

Daraus würde ich derzeit nicht schließen, dass sich das Modell selbst verschlechtert hat. Routing, Quoten, Infrastruktur oder die AI-Studio-Oberfläche könnten die Ursache sein, und von außen sehen diese Probleme fast gleich aus.

Warum das den schnellen Entwicklungszyklus unterbricht

Beim Prototyping verwandelt eine solche Verzögerung ein interaktives Werkzeug in eine Aufgabenwarteschlange. Wenn jede kurze Anfrage 40–50 Sekunden benötigt, verlieren Prompt-Debugging, die Prüfung strukturierter Ausgaben und der Vergleich von Varianten schnell an Nutzen.

Zuerst sollte man die Zeit bis zum ersten Token von der gesamten Generierungsdauer trennen und dann kurze mit langen Kontexten vergleichen. Fehler 503 deuten auf die Infrastrukturebene hin, während eine Verschlechterung nur bei etwa 50.000 Token eher nach Kontextskalierung oder einem Problem der Benutzeroberfläche aussieht.

Die zentrale Ungewissheit ist nicht, ob AI Studio für manche Nutzer langsam arbeitet; das zeigen die Berichte bereits. Entscheidend ist, wo die Verzögerung entsteht: innerhalb von Gemini 3 Flash Preview oder in einer Komponente darum herum.

Wir haben Gemini zuvor mit spezialisierten Tools für Meeting-Zusammenfassungen in Google Meet verglichen, einschließlich Genauigkeit und operativer Einschränkungen. Dieser Vergleich hilft Teams einzuschätzen, wie sich Instabilität bei Gemini auf tägliche Arbeitsabläufe auswirken kann.