Pourquoi Vertex AI a coûté plus cher que Claude
Vertex AIClaudeэкономика ИИ
La même tâche, une économie différente
Ce qui frappe ici n’est pas le prix du token lui-même, mais l’écart entre deux façons d’acheter le même résultat. Dans la discussion utilisateur d’origine, une tâche effectuée avec l’abonnement Claude à 20 $ a consommé 15 % d’une limite de quatre heures et représenté environ 3 $ de valeur virtuelle. La même tâche a coûté 10 $ via Claude Sonnet 5 dans Google Cloud Vertex AI.
Il ne s’agit pas d’un benchmark universel. Nous ne connaissons ni le nombre exact de tokens d’entrée et de sortie, ni les succès de cache, les appels répétés ou les paramètres des deux exécutions. La date du cas n’est pas précisée non plus : ces chiffres doivent donc être vus comme un instantané des conditions au moment de la discussion, et non comme un tarif garanti pour septembre 2026.
Le signal d’ingénierie reste néanmoins réel : les limites d’abonnement et la facturation API comptabilisent la charge de manière fondamentalement différente. Un abonnement peut être plus économique pour le travail interactif intensif d’un utilisateur, tandis que Vertex AI facture chaque appel programmatique. Disposer de 15 000 $ de crédits Google Cloud ne rend pas l’appel moins cher ; cela masque seulement la dépense temporairement.
La première étape serait de décomposer la trace de l’agent : taille du prompt système, historique, réponses des outils, nombre de tentatives et longueur de génération. Même passer à Haiku ne suffira pas si le harnais renvoie le même contexte à chaque boucle.
La liste pratique des optimisations est courte :
- raccourcir les instructions et supprimer les doublons dans le harnais, comme cela a été proposé pour Pi ;
- placer les instructions stables et les schémas d’outils dans un préfixe exploitable par le cache ;
- router les étapes simples vers un modèle plus petit ;
- limiter la longueur des réponses, les tentatives et les branches parallèles ;
- mesurer le coût de toute la trace de l’agent, et non d’une seule requête.
La recommandation sur le cache rejoint la documentation d’Anthropic sur le prompt caching : la partie réutilisée du contexte doit rester stable et se trouver au début de la requête.
Quand l’abonnement gagne et pourquoi l’API reste utile
Pour un travail manuel régulier, l’abonnement paraît plus économique dans ce cas. Pour l’automatisation, la conclusion est moins simple : les abonnements n’étaient pas vendus via Google Marketplace et le budget de l’entreprise était lié aux crédits Google Cloud.
Vertex AI conserve tout son intérêt lorsqu’il faut des agents programmatiques, des tâches parallèles et une facturation à l’usage réel. Sans télémétrie, toutefois, un agent peut facilement transformer un long contexte, des reprises et des réponses prolixes en fuite budgétaire invisible.
Je ne choisirais pas entre un abonnement et Vertex AI sur le prix d’une seule exécution. La véritable unité de comparaison n’est ni le token ni la licence utilisateur, mais une tâche achevée avec succès, tous cycles d’agent compris. C’est précisément ce coût que la plupart des équipes mesurent encore le moins bien.