3 мин чтения

Gemini 3.8 Flash: быстрый миллион токенов

Gemini 3.8 FlashGemini APIt3 code

Gemini 3.8 Flash получила контекстное окно на 1 млн токенов и, по независимым замерам, выдает около 305 токенов в секунду при высоком уровне рассуждений. Это делает модель особенно интересной для ресерча, дата-майнинга и длинных рутинных задач, а t3 code добавляет единый интерфейс к нескольким кодовым агентам.

Что показала Gemini 3.8 Flash

Я бы начал с сочетания, которое здесь действительно меняет расклад: контекстное окно на 1 млн токенов плюс высокая скорость генерации. Google указывает этот объем контекста в документации Gemini API, а независимые обзоры со ссылкой на замеры Artificial Analysis сообщают примерно о 305 выходных токенах в секунду при высоком уровне рассуждений.

Цены на момент анонса тоже выглядят агрессивно. До 31 декабря 2026 года ввод стоит $0.75 за 1 млн токенов, вывод обойдется в $3.75. С 1 января 2027 года стандартные ставки должны составить соответственно $1.50 и $7.50.

Практический отзыв от 8 сентября хорошо совпадает с этой картиной, хотя это именно пользовательское наблюдение, а не контролируемый тест. Gemini 3.8 Flash описывают как очень быструю модель, которая хорошо следует инструкциям, держит длинные задачи и создает мало трения из-за ограничений. Особенно удачными сценариями названы ресерч, дата-майнинг и рутинные операции.

Есть и честная граница наблюдений: серьезные задачи по программированию автор отзыва пока не проверял. Поэтому переносить положительное впечатление от сбора данных на сложный рефакторинг, отладку или изменение большой кодовой базы рано. Скорость ответа и способность надежно менять код часами все еще разные характеристики.

Модель запускалась через t3 code. Этот CLI дает единый интерфейс для Codex, Claude Code, Antigravity и Grok с авторизацией через OAuth, а также предлагает удобный UI. Для сравнения агентов это полезная прослойка: меньше переключений между отдельными инструментами, быстрее видно, какая модель лучше справляется с конкретным типом задачи.

Где миллионный контекст реально полезен

Главный выигрыш получат задачи, где материалов много, а результат нужен быстро: анализ массивов документов, длинный ресерч и извлечение данных. Контекст на 1 млн токенов уменьшает необходимость заранее дробить входные данные, а высокая скорость делает повторные проходы менее болезненными.

Но большое окно само по себе не гарантирует внимательность ко всему содержимому. Я бы первым делом проверял поиск деталей в разных частях контекста, устойчивость к противоречивым источникам и точность ссылок на исходные фрагменты. Именно там красивый лимит часто перестает быть полезной емкостью.

Второй риск скрыт в выводе: он заметно дороже ввода даже по вводным ценам. Для рутинных пайплайнов это означает, что длинные рассуждения и многословные ответы способны быстро съесть преимущество дешевого большого контекста.

Пока Gemini 3.8 Flash выглядит не просто как погоня за цифрами. Но окончательный тест для модели такого класса начинается там, где длинная задача требует не скорости, а дисциплины на протяжении всего контекста.

Мы уже разбирали, как параллельные агенты Claude Code находят race conditions в PR и влияют на стоимость CI/CD. Этот опыт дополняет сравнение производительности и мультиагентных сценариев Gemini 3.8 Flash и t3 code.