3 min de lecture

Astra et Sol : où le coût des tokens augmente vraiment

AstraSolцены API

Les tarifs publiés placent Astra à 10 $ par million de tokens d’entrée et 50 $ en sortie, contre 5 $ et 30 $ pour Sol en mode standard. Le mode Fast double généralement les tarifs applicables. Le multiplicateur de dépenses de 6,25 n’est pas confirmé par les prix officiels, mais le contexte long et les sorties volumineuses alourdissent la facture.

Ce que révèlent les tarifs et les limites

Je n’intégrerais pas au budget la hausse de dépenses annoncée de 6,25 fois : les prix publiés ne la confirment pas. Au 6 septembre 2026, la documentation OpenAI et la page tarifaire officielle indiquent pour Astra des tarifs standard de 10 $ par million de tokens d’entrée, 1 $ par million de tokens d’entrée mis en cache, 12,50 $ par million d’écritures en cache et 50 $ par million de tokens de sortie.

Le mode Fast d’Astra double les tarifs applicables. Pour les requêtes dépassant 272 000 tokens d’entrée, la requête entière est recalculée : l’entrée passe à 20 $ par million et la sortie à 75 $. Il ne s’agit pas d’un supplément marginal sur la seule partie excédentaire, mais d’un nouveau prix pour toute la requête. Franchir le seuil par inadvertance peut donc fortement déséquilibrer la facture.

Les documents tarifaires compilés pour Sol indiquent 5 $ par million de tokens d’entrée et 30 $ par million de tokens de sortie en mode standard. Fast ou Priority coûtent respectivement 10 $ et 60 $, soit un multiplicateur de deux et non de 2,5. Ces tarifs ne produisent pas non plus une dépense 6,25 fois supérieure.

Les limites constituent un sujet distinct. La documentation d’Astra montre une progression de 500 requêtes par minute et 500 000 tokens par minute au Tier 1 à 15 000 requêtes et 40 millions de tokens par minute au Tier 5. À forte fréquence, les tokens par minute atteignent généralement le plafond avant le nombre de requêtes.

Des utilisateurs signalent aussi une baisse de la limite disponible d’environ 20 % sur neuf heures et de 13 % sur une heure lorsqu’ils travaillent dans deux fils. Ces observations ne peuvent pas être transformées directement en multiplicateur de prix sans données sur la longueur du contexte, la sortie, le cache et le mode choisi. Pour Fable, les sources rassemblées ne contiennent même pas de tableau officiel des tarifs et limites ; une comparaison chiffrée honnête reste donc impossible.

Comment cela modifie le calcul du budget

Le risque principal n’est pas le prix de base, mais la combinaison d’une sortie chère, du mode Fast et d’un contexte long. Je calculerais séparément les tokens d’entrée et de sortie, puis je doublerais le résultat pour Fast et modéliserais à part les requêtes susceptibles de franchir le seuil Astra de 272 000 tokens.

Les prompts répétés changent sensiblement l’économie d’Astra : l’entrée en cache coûte 1 $ par million contre 10 $ pour une entrée normale. Toutefois, le cache ne résout pas le coût élevé de la sortie, et un débit élevé ne supprime pas les contraintes de TPM. Un coût moyen par requête est donc presque inutile sans distribution des longueurs.

En résumé, les tarifs officiels montrent un surcoût Fast de deux fois, et non de 6,25 fois. Tant que le mécanisme des limites utilisateur et les données de Fable ne sont pas publiés, l’écart entre la grille tarifaire et les prélèvements observés demeure la principale inconnue.

Nous avons précédemment analysé comment le coût du contexte et les réglages de Claude Opus 4.6 influencent les dépenses totales liées au modèle. Cette analyse aide à comparer l’approche d’Astra concernant les tokens et les surcoûts à celle d’autres modèles.