Gemini 3 Flash Preview répond en 40 à 50 secondes
Gemini 3 Flash PreviewGoogle AI Studioзадержка ИИ
Ce qui se passe avec la latence dans Google AI Studio
Pour au moins une partie des utilisateurs de Google AI Studio, Gemini 3 Flash Preview ne semble soudainement plus très flash. Depuis midi le 23 septembre 2026, ils signalent des temps de réponse de 40 à 50 secondes au lieu des 2 à 3 secondes habituelles. Les informations disponibles ne contiennent aucune confirmation officielle de Google concernant un incident distinct ; il est donc trop tôt pour parler de panne mondiale.
Le contraste est particulièrement frappant au regard de la documentation officielle de Google sur Gemini 3 Flash Preview. Le modèle reste en aperçu public et est présenté comme une option axée sur la faible latence et l’efficacité, plutôt que sur une profondeur maximale de raisonnement. Des délais de plusieurs dizaines de secondes vont directement à l’encontre de son principal cas d’usage : des cycles rapides de requête, de vérification et de correction.
Les comparaisons indépendantes donnaient auparavant une image très différente. Certaines mesures situaient le délai avant le premier token autour de 0,91 à 0,95 seconde, avec des vitesses de génération atteignant 195,8 à 218 tokens par seconde. Une autre comparaison pour Google AI Studio indiquait une latence de 1,17 seconde et un débit de 74 tokens par seconde, ce qui montre qu’une variabilité existait déjà avant les plaintes actuelles.
Le forum des développeurs Google contient aussi des cas plus graves : un utilisateur payant Tier 2 a signalé des réponses de 80 à 356 secondes ainsi que de fréquentes erreurs 503. Selon lui, le support Google a reconnu que la latence dépassait les objectifs visés. Dans un autre fil, un fort ralentissement a été associé à un contexte d’environ 50 000 tokens, au rendu de l’interface et aux requêtes de comptage de tokens.
À ce stade, je ne conclurais pas que le modèle lui-même s’est dégradé. Le routage, les quotas, l’infrastructure ou l’interface d’AI Studio peuvent être en cause, et ces problèmes paraissent presque identiques vus de l’extérieur.
Pourquoi cela casse le cycle de développement rapide
Pour le prototypage, cette latence transforme un outil interactif en file d’attente. Lorsque chaque courte requête prend 40 à 50 secondes, le débogage des prompts, la vérification des sorties structurées et la comparaison de variantes perdent rapidement leur intérêt.
Il faut d’abord distinguer le temps avant le premier token de la durée totale de génération, puis comparer les contextes courts et longs. Les erreurs 503 orientent vers la couche d’infrastructure, tandis qu’une dégradation limitée aux environs de 50 000 tokens évoque davantage une montée en charge du contexte ou un problème d’interface.
L’incertitude principale n’est pas de savoir si AI Studio est lent pour certains utilisateurs : les signalements le montrent déjà. La question est de déterminer où le délai apparaît, au sein de Gemini 3 Flash Preview ou dans un composant qui l’entoure.