3 мин чтения

Почему Vertex AI оказался дороже подписки Claude

Vertex AIClaudeэкономика ИИ

В одном корпоративном кейсе одинаковая задача стоила $10 через Claude Sonnet 5 в Vertex AI и примерно $3 виртуальной стоимости по подписке Claude за $20. Разница важна: подписка может быть выгоднее при интенсивной интерактивной работе, а API требует строгого контроля токенов, кэша и маршрутизации.

Одинаковая задача, разная экономика

Меня здесь цепляет не сама цена токена, а разрыв между двумя способами купить один и тот же результат. В исходном пользовательском обсуждении задача на подписке Claude за $20 израсходовала 15% четырехчасового лимита и около $3 виртуальной стоимости. Через Claude Sonnet 5 в Google Cloud Vertex AI та же задача стоила $10.

Это не универсальный бенчмарк. Нет данных о точном числе входных и выходных токенов, попаданиях в кэш, повторных вызовах и настройках обоих запусков. Дата кейса также не указана, поэтому цифры стоит воспринимать как снимок условий на момент обсуждения, а не как гарантированный тариф на сентябрь 2026 года.

Но инженерный сигнал вполне реальный: подписочный лимит и API-биллинг считают нагрузку принципиально по-разному. Подписка может быть выгоднее для плотной интерактивной работы одного пользователя, тогда как Vertex AI списывает стоимость каждого программного вызова. Наличие $15 000 кредитов Google Cloud не делает вызов дешевле, оно лишь временно скрывает расход.

Первым делом я бы разложил трассу агента по шагам: размер системного промпта, история, ответы инструментов, число повторов и длина генерации. Даже переход на Haiku не спасет, если харнес пересылает один и тот же контекст на каждом витке.

Практический набор оптимизаций здесь короткий:

  • сократить инструкции и убрать дублирование в харнесе, как предлагалось для Pi;
  • вынести стабильные инструкции и схемы инструментов в кэшируемый префикс;
  • маршрутизировать простые шаги на меньшую модель;
  • ограничить длину ответов, повторы и параллельные ветки;
  • считать стоимость всей агентской трассы, а не одного запроса.

Рекомендация по кэшированию совпадает с документацией Anthropic по prompt caching: повторяемая часть контекста должна оставаться стабильной и располагаться в начале запроса.

Когда подписка выигрывает, а API остается нужен

Для постоянной ручной работы подписка в этом кейсе выглядит экономичнее. Для автоматизации вывод уже не такой простой: подписки не продавались через Google Marketplace, а корпоративный бюджет был привязан к кредитам Google Cloud.

Vertex AI сохраняет смысл там, где нужны программные агенты, параллельные задачи и оплата фактического потребления. Но без телеметрии агент легко превращает длинный контекст, ретраи и многословные ответы в незаметную утечку бюджета.

Я бы не выбирал между подпиской и Vertex AI по цене одного запуска. Настоящая единица сравнения здесь не токен и не место пользователя, а успешно завершенная задача со всеми циклами агента. Именно эту стоимость большинство команд пока измеряет хуже всего.

Мы ранее разбирали, как настройки Claude Opus 4.6, длина контекста и режим extended thinking меняют стоимость работы модели. Эти параметры стоит учитывать при сопоставлении подписок Claude с расходами на Vertex AI при бюджете 15 тыс. долларов в месяц.