3 min de lecture

Claude Opus 5.5 explique mieux les erreurs, mais adore les TLDR

Claude Opus 5.5Anthropicпромпт-инжиниринг

D’après les retours d’utilisateurs, Claude Opus 5.5 explique les erreurs plus clairement qu’Opus 5 et sa limite hebdomadaire peut sembler généreuse. Anthropic annonce un contexte d’un million de tokens et jusqu’à 128 000 tokens en sortie. Les résumés TLDR restent toutefois une habitude stylistique bien visible.

Le principal changement ne se voit pas seulement dans les benchmarks

Ce qui retient l’attention ici n’est pas une nouvelle hausse de score, mais un élément plus concret : selon le retour d’un utilisateur, Claude Opus 5.5 explique désormais les erreurs plus clairement. Là où Opus 5 suggérait à plusieurs reprises un bug dans un langage vague, presque « cosmique », sans aller à l’essentiel, la nouvelle version a pu formuler le problème correctement.

Le tableau officiel confirme aussi une mise à jour majeure. La documentation de Claude Platform et les notes de version d’Anthropic présentent le modèle comme un outil destiné aux longues tâches agentiques de programmation et de travail sur les connaissances. Elles indiquent un contexte d’un million de tokens, une sortie maximale de 128 000 tokens et une réflexion adaptative toujours active, pilotée par le réglage effort.

Dans les documents publiés par Anthropic, Opus 5.5 atteint 66,4 % sur Terminal-Bench 4.0, contre 52,3 % pour Opus 5. Sur GDPval-AA v2.1, 1846 Elo sont annoncés contre 1708. Ce ne sont pas des tests directs de qualité linguistique, mais ces résultats concordent avec l’idée que le modèle gère plus fiablement les instructions complexes et les enchaînements d’actions.

Au lancement, le tarif était de 4 dollars par million de tokens en entrée et de 20 dollars par million de tokens en sortie. Un autre utilisateur indique également ne pas approcher la limite hebdomadaire. Il ne faut pas généraliser cette expérience : la consommation dépend fortement de la longueur du contexte, du mode de travail et du nombre d’itérations agentiques.

La clarté progresse, les habitudes de style restent

Pour le travail concret, c’est une vraie amélioration : une explication claire d’un bug vaut mieux qu’une belle allusion. Si le modèle localise plus vite la cause d’une défaillance et l’exprime en langage courant, il faut moins de questions de suivi et le risque de manquer un détail important derrière une prose assurée diminue.

Mais il reste un coût stylistique familier. Dans la discussion, un autre utilisateur décrit TLDR comme l’un des mots les plus fréquents dans les textes des versions récentes d’Opus. C’est une observation anecdotique, pas une caractéristique mesurée du modèle, mais le signal est clair pour les spécialistes des prompts : il vaut mieux définir explicitement le format de réponse, surtout lorsqu’un résumé automatique casse la structure attendue.

Je vérifierais d’abord non pas l’élégance d’une réponse isolée, mais la stabilité sur une longue série de tâches : le modèle reste-t-il clair, évite-t-il de répéter les résumés et ne dissimule-t-il pas les détails derrière TLDR ? La vraie question pour Opus 5.5 n’est plus de savoir s’il sait raisonner, mais avec quelle discipline il le montre.

Nous avions déjà traité du revirement d’Anthropic sur les dégradations cachées des requêtes Claude et de ce qu’il révélait sur la transparence du comportement des modèles. Le débat sur Opus 5.5 montre de même pourquoi les changements de qualité des réponses exigent un examen clair plutôt qu’une confiance aveugle.