Gemini 3 Flash Preview tarda 40–50 segundos en responder
Gemini 3 Flash PreviewGoogle AI Studioзадержка ИИ
Qué ocurre con la latencia en Google AI Studio
Para al menos una parte de los usuarios de Google AI Studio, Gemini 3 Flash Preview dejó de sentirse realmente flash de un día para otro. Desde el mediodía del 23 de septiembre de 2026, reportan tiempos de respuesta de 40–50 segundos en lugar de los 2–3 segundos habituales. No hay confirmación oficial de Google sobre un incidente independiente en la información disponible, así que todavía es pronto para hablar de una caída global.
El contraste resulta especialmente llamativo frente a la documentación oficial de Google sobre Gemini 3 Flash Preview. El modelo sigue en vista previa pública y se presenta como una opción centrada en baja latencia y eficiencia, no en la máxima profundidad de razonamiento. Esperar decenas de segundos contradice directamente su caso de uso principal: ciclos rápidos de solicitud, revisión y corrección.
Las comparativas independientes mostraban antes una realidad muy distinta. Algunas mediciones situaban el tiempo hasta el primer token en unos 0,91–0,95 segundos, con velocidades de generación de hasta 195,8–218 tokens por segundo. Otra comparación para Google AI Studio indicó 1,17 segundos de latencia y un rendimiento de 74 tokens por segundo, lo que confirma que ya existía cierta variación antes de las quejas actuales.
El foro de desarrolladores de Google también recoge casos más graves: un usuario de pago de Tier 2 informó de respuestas de 80–356 segundos y errores 503 frecuentes. Según ese usuario, el soporte de Google reconoció que la latencia superaba los objetivos previstos. En otro hilo, la fuerte ralentización se relacionó con contextos de unas 50.000 tokens, el renderizado de la interfaz y las solicitudes de conteo de tokens.
Por ahora, no concluiría que el propio modelo se haya degradado. Podrían intervenir problemas de enrutamiento, cuotas, infraestructura o la interfaz de AI Studio, y desde fuera todos pueden parecer prácticamente iguales.
Por qué esto rompe el ciclo rápido de desarrollo
Para crear prototipos, esta demora convierte una herramienta interactiva en una cola de tareas. Cuando cada solicitud corta tarda 40–50 segundos, depurar prompts, validar salidas estructuradas y comparar variantes pierde rápidamente utilidad.
Lo primero sería separar el tiempo hasta el primer token de la duración total de generación y después comparar contextos cortos y largos. Los errores 503 apuntan a la capa de infraestructura, mientras que una degradación solo cerca de 50.000 tokens se parece más a un problema de escalado del contexto o de la interfaz.
La principal incertidumbre no es si AI Studio funciona lentamente para algunos usuarios; los reportes ya lo muestran. La cuestión es dónde surge la demora: dentro de Gemini 3 Flash Preview o en algún componente que lo rodea.