Contexte technique
J’ai plongé dans l’analyse de Redwood et dans l’article lui-même parce que le sujet n’est pas anodin : si le modèle peut calculer à l’intérieur de tokens inutiles, l’automatisation par IA ne peut plus être jugée uniquement sur la réponse visible. Et oui, ce n’est pas une jolie métaphore, mais un comportement observable dans les nouveaux modèles.
L’idée est simple. On ajoute au prompt une queue dénuée de sens : points, symboles, compteurs, tokens vides. Les anciens modèles les ignoraient pour la plupart, mais les modèles frontaliers récents, comme le montrent Redwood et l’article « Reading Between the Dots », utilisent ces zones comme mémoire de travail pour des calculs intermédiaires cachés.
Ce qui m’a accroché, ce n’est pas le mot filler lui-même, mais le mécanisme. Le modèle n’est pas obligé d’écrire une chaîne de pensée à l’extérieur, mais il peut tout de même faire passer des représentations utiles à travers les états cachés à ces positions. Les auteurs montrent que ce calcul est partiellement décodable depuis les états internes : les premières couches extraient les faits, les dernières les combinent.
Les chiffres ne sont pas vides non plus. La précision mathématique d’Opus 4.5 sans CoT est passée de ~45 % à 51 % avec les tokens de remplissage ; DeepSeek V3 a gagné encore plus sur certaines tâches. Mais une réserve importante : il s’agit davantage de profondeur computationnelle parallèle que de long raisonnement séquentiel pas à pas.
Autrement dit, les tokens de remplissage ne transforment pas le transformer en une bande de réflexion infinie. Ils donnent plutôt au modèle un espace supplémentaire pour répartir les sous-tâches, redistribuer les activations et ensuite assembler la réponse. Pour l’interprétabilité, c’est à la fois élégant et dérangeant.
Impact sur les affaires et l’automatisation
Pour l’implémentation concrète de l’IA, ma conclusion est brutale : le texte de raisonnement visible n’égale pas le raisonnement réel. Si vous construisez des vérifications, des garde-fous ou des audits autour de « montre ton raisonnement », ce pilier vient de s’affaiblir.
Le deuxième effet est architectural. L’ingénierie de prompt et l’intégration de l’IA ne reposent plus seulement sur des instructions parfaites, mais aussi sur la façon dont le contexte donne au modèle de l’espace pour des calculs internes. Cela peut améliorer la qualité sur les tâches complexes tout en brisant la prévisibilité et le coût d’inférence.
Qui y gagne ? Les équipes qui testent les modèles au niveau du comportement et des traces, pas celles qui font confiance à une jolie CoT. Qui y perd ? Ceux qui vendent de la « transparence » basée uniquement sur le texte de sortie. Chez Nahornyi AI Lab, nous décortiquons précisément ces questions en pratique : là où le calcul caché aide et là où il crée un risque dans les solutions d’IA pour l’entreprise.
Si votre automatisation IA tourne déjà dans des processus critiques, je n’attendrais pas la prochaine surprise du modèle. Parcourons calmement votre pipeline, vérifions où le contrôle est illusoire, et chez Nahornyi AI Lab construisons le développement de solutions IA pour que le système fasse gagner du temps au lieu d’introduire des risques cachés au pire moment.