2 мин чтения

Gemini 3 Flash Preview отвечает по 40–50 секунд

Gemini 3 Flash PreviewGoogle AI Studioзадержка ИИ

23 сентября 2026 года пользователи начали сообщать, что Gemini 3 Flash Preview в Google AI Studio отвечает за 40–50 секунд вместо привычных 2–3 секунд. Для модели, которую Google описывает как ориентированную на низкую задержку и эффективность, это критичный сбой рабочего ритма, хотя официального подтверждения отдельного инцидента пока нет.

Что происходит с задержкой в Google AI Studio

Похоже, Gemini 3 Flash Preview внезапно перестал быть flash хотя бы для части пользователей Google AI Studio. С полудня 23 сентября 2026 года они сообщают о времени ответа в 40–50 секунд вместо привычных 2–3 секунд. Официального подтверждения отдельного инцидента со стороны Google в исходных данных нет, поэтому говорить о глобальном сбое пока рано.

Контраст особенно заметен на фоне официальной документации Google по Gemini 3 Flash Preview. Там модель остается в публичном превью и позиционируется как вариант с упором на низкую задержку и эффективность, а не на максимальную глубину рассуждений. Задержка в десятки секунд прямо противоречит основному сценарию такой модели: быстрым циклам запроса, проверки и исправления.

Независимые сравнения показывали совсем другую картину. В отдельных замерах время до первого токена составляло около 0,91–0,95 секунды, а скорость генерации доходила до 195,8–218 токенов в секунду. Другое сравнение для Google AI Studio указывало задержку 1,17 секунды и пропускную способность 74 токена в секунду, то есть разброс существовал и до нынешних жалоб.

На форуме разработчиков Google есть и более тяжелые случаи: пользователь платного Tier 2 сообщал об ответах за 80–356 секунд и частых ошибках 503. По его словам, поддержка Google признала, что задержка выходит за целевые показатели. В другой ветке резкое замедление связывали с контекстом около 50 тысяч токенов, рендерингом интерфейса и запросами подсчета токенов.

Из этого я бы пока не делал вывод, что деградировала сама модель. Возможны проблемы маршрутизации, квот, инфраструктуры или интерфейса AI Studio, и внешне они выглядят почти одинаково.

Почему это ломает быстрый цикл разработки

Для прототипирования такая задержка превращает интерактивный инструмент в очередь задач. Когда каждый короткий запрос занимает 40–50 секунд, отладка промпта, проверка структурированного вывода и сравнение вариантов быстро теряют смысл.

Первым делом я бы разделял время до первого токена и полную длительность генерации, а затем сравнивал короткий и длинный контекст. Ошибки 503 указывают на инфраструктурный слой, тогда как ухудшение только возле 50 тысяч токенов сильнее похоже на масштабирование контекста или проблемы интерфейса.

Главная неопределенность сейчас не в том, медленно ли работает AI Studio у части пользователей, это уже видно по сообщениям. Вопрос в том, где именно возникла задержка: внутри Gemini 3 Flash Preview или вокруг него.

Ранее мы сравнили Gemini со специализированными инструментами для подготовки итогов встреч в Google Meet, включая точность и операционные ограничения. Это сравнение помогает командам оценить, как нестабильность сервиса Gemini может влиять на повседневные рабочие процессы.