3 min de lecture

Claude Sonnet 5.5 : un million de tokens à moindre coût

Claude Sonnet 5.5AnthropicLLM

Anthropic a lancé Claude Sonnet 5.5 comme modèle Sonnet principal pour son API. Il offre une fenêtre de contexte d'un million de tokens, jusqu'à 128 000 tokens en sortie et un tarif à partir de 2 $ par million de tokens en entrée. L'enjeu est l'association du contexte long, du raisonnement adaptatif et d'économies annoncées jusqu'à 30 %.

Ce qu'Anthropic a exactement lancé

Ce qui retient l'attention n'est pas le numéro de version, mais l'ensemble de capacités concrètes qu'Anthropic réunit dans Sonnet 5.5. Sur la page officielle de Claude Sonnet 5.5 et dans l'aperçu des modèles de Claude Platform, l'entreprise le présente comme le Sonnet principal pour l'API et comme un équilibre entre vitesse et intelligence. Ce n'est plus une vitrine expérimentale, mais un point d'entrée opérationnel dans la gamme.

La fenêtre de contexte atteint un million de tokens et la sortie maximale 128 000 tokens. Le modèle prend en charge le raisonnement adaptatif, avec un niveau d'effort réglé par défaut sur high. Dans l'API, il porte l'identifiant claude-sonnet-5-5 : la migration est donc explicite, plutôt qu'un remplacement discret sous un ancien nom.

Au lancement, le tarif de base était de 2 $ par million de tokens en entrée et de 10 $ par million en sortie. Batch API applique une remise de 50 % dans les deux sens. Pour le prompt caching, la lecture coûte 0,20 $ par million de tokens, l'écriture standard 2,50 $, et l'écriture avec un TTL d'une heure 4 $.

Anthropic indique qu'une charge de travail typique peut coûter jusqu'à 30 % moins cher qu'avec Sonnet 5, alors que les tarifs de base sont identiques. Le principal effet ne vient donc pas d'un nouveau prix catalogue, mais de l'efficacité d'exécution et de facturation.

Là où cette sortie change réellement la donne

Pour les équipes API, il s'agit d'une évolution réelle, et non d'un simple changement dans le catalogue. Un million de tokens de contexte intéresse les agents, les grandes bases de code et les longues chaînes de documents ; les 128 000 tokens de sortie réduisent aussi certaines limites pour produire des artefacts volumineux. Toutefois, une limite élevée ne garantit pas que le modèle exploite tout le contexte avec une qualité homogène.

Je vérifierais d'abord trois points :

  • la précision des faits provenant de différentes sections d'un prompt long ;
  • l'effet du niveau high sur la latence et la consommation de tokens ;
  • le maintien des économies annoncées dans de vrais cycles d'agents utilisant outils et cache.

Les cas les plus favorables sont ceux où la capacité de contexte et la réutilisation des prompts comptent davantage que le coût minimal d'une requête. Le risque habituel demeure : un modèle performant avec un effort élevé peut transformer l'économie sur l'entrée en facture importante pour de longs raisonnements et sorties. Avec Sonnet 5.5, la vraie question n'est pas le million de tokens, mais la prévisibilité de cette capacité en charge.

Nous avons déjà montré comment Claude Sonnet peut soutenir des agents parallèles de revue de code et révéler des conditions de course dans les pull requests. Ce cas d'usage concret aide à comprendre où une nouvelle version de Sonnet peut modifier les workflows d'ingénierie.