Gemini 3 Flash Preview відповідає по 40–50 секунд
Gemini 3 Flash PreviewGoogle AI Studioзадержка ИИ
Що відбувається із затримкою в Google AI Studio
Схоже, для принаймні частини користувачів Google AI Studio Gemini 3 Flash Preview раптово перестав бути справді flash. Із полудня 23 вересня 2026 року вони повідомляють про час відповіді 40–50 секунд замість звичних 2–3 секунд. В оприлюдненій інформації немає офіційного підтвердження окремого інциденту від Google, тому називати це глобальним збоєм поки зарано.
Контраст особливо помітний на тлі офіційної документації Google щодо Gemini 3 Flash Preview. Модель досі перебуває у публічному прев’ю та позиціонується як варіант із фокусом на низькій затримці й ефективності, а не на максимальній глибині міркувань. Затримка в десятки секунд прямо суперечить головному сценарію такої моделі: швидким циклам запиту, перевірки та виправлення.
Незалежні порівняння раніше показували зовсім іншу картину. В окремих вимірюваннях час до першого токена становив близько 0,91–0,95 секунди, а швидкість генерації сягала 195,8–218 токенів за секунду. Інше порівняння для Google AI Studio вказувало на затримку 1,17 секунди та пропускну здатність 74 токени за секунду, тобто розкид існував і до нинішніх скарг.
На форумі розробників Google є й важчі випадки: користувач платного Tier 2 повідомляв про відповіді за 80–356 секунд і часті помилки 503. За його словами, підтримка Google визнала, що затримка перевищує цільові показники. В іншій гілці різке сповільнення пов’язували з контекстом близько 50 тисяч токенів, рендерингом інтерфейсу та запитами на підрахунок токенів.
Наразі я б не робив висновок, що деградувала сама модель. Причиною можуть бути маршрутизація, квоти, інфраструктура або інтерфейс AI Studio, і зовні ці проблеми виглядають майже однаково.
Чому це руйнує швидкий цикл розробки
Для прототипування така затримка перетворює інтерактивний інструмент на чергу завдань. Коли кожен короткий запит триває 40–50 секунд, налагодження промптів, перевірка структурованого виводу та порівняння варіантів швидко втрачають сенс.
Насамперед варто відокремити час до першого токена від повної тривалості генерації, а потім порівняти короткий і довгий контекст. Помилки 503 вказують на інфраструктурний шар, тоді як погіршення лише біля 50 тисяч токенів більше схоже на масштабування контексту або проблему інтерфейсу.
Головна невизначеність зараз не в тому, чи повільно AI Studio працює для частини користувачів — це вже видно з повідомлень. Питання в тому, де саме виникла затримка: усередині Gemini 3 Flash Preview чи навколо нього.