3 хв читання

Gemini 3.8 Flash: швидкий мільйон токенів

Gemini 3.8 FlashGemini APIt3 code

Gemini 3.8 Flash має вікно контексту на мільйон токенів і, за незалежними вимірами, генерує приблизно 305 токенів за секунду на високому рівні міркувань. Це робить її цікавою для досліджень, дата-майнінгу та довгих рутинних задач, а t3 code об’єднує кілька кодових агентів в одному інтерфейсі.

Що показала Gemini 3.8 Flash

Я б почав із поєднання, яке тут справді змінює ситуацію: вікно контексту на мільйон токенів і висока швидкість генерації. Google вказує такий обсяг контексту в документації Gemini API, а незалежні огляди з посиланням на виміри Artificial Analysis повідомляють про приблизно 305 вихідних токенів за секунду на високому рівні міркувань.

Ціни на момент анонсу також виглядають агресивними. До 31 грудня 2026 року введення коштує $0.75 за мільйон токенів, а виведення — $3.75. З 1 січня 2027 року стандартні ставки, як очікується, становитимуть $1.50 і $7.50 відповідно.

Практичний відгук від 8 вересня добре узгоджується з цією картиною, хоча це користувацьке спостереження, а не контрольований тест. Gemini 3.8 Flash описують як дуже швидку модель, яка добре дотримується інструкцій, утримує довгі задачі та створює мало тертя через обмеження. Особливо вдалими названо дослідження, дата-майнінг і рутинні операції.

Є й чесна межа цих спостережень: серйозні завдання з програмування автор відгуку ще не перевіряв. Тому зарано переносити позитивне враження від збирання даних на складний рефакторинг, налагодження або зміни у великій кодовій базі. Швидкість відповіді та здатність надійно змінювати код годинами — різні характеристики.

Модель запускали через t3 code. Цей CLI надає єдиний інтерфейс для Codex, Claude Code, Antigravity і Grok, підтримує OAuth-авторизацію та має зручний UI. Для порівняння агентів це корисний прошарок: менше перемикань між окремими інструментами й швидше видно, яка модель краще справляється з конкретним типом задачі.

Де мільйонний контекст справді корисний

Найбільшу користь отримають задачі, де багато матеріалів, а результат потрібен швидко: аналіз масивів документів, тривалі дослідження та вилучення даних. Контекст на мільйон токенів зменшує потребу заздалегідь ділити вхідні дані, а висока швидкість робить повторні проходи менш болісними.

Проте велике вікно саме по собі не гарантує уважності до всього вмісту. Я б насамперед перевіряв пошук деталей у різних частинах контексту, стійкість до суперечливих джерел і точність посилань на початкові фрагменти. Саме там гарний ліміт часто перестає бути корисною місткістю.

Другий ризик приховано у виведенні: навіть за стартовими цінами воно помітно дорожче за введення. Для рутинних пайплайнів це означає, що довгі міркування та багатослівні відповіді можуть швидко з’їсти перевагу дешевого великого контексту.

Наразі Gemini 3.8 Flash виглядає не просто як гонитва за цифрами. Але остаточний тест для моделі такого класу починається там, де довга задача потребує не швидкості, а дисципліни впродовж усього контексту.

Ми вже розглядали, як паралельні агенти Claude Code знаходять race conditions у PR і впливають на вартість CI/CD. Цей досвід доповнює порівняння продуктивності та мультиагентних сценаріїв Gemini 3.8 Flash і t3 code.