3 min de lecture

Comment agents.md influence le coût d'un agent de code

agents.mdкодовые агентыпромпт-инжиниринг

Un agents.md concis réduit le coût d'un agent de code cyclique, car ses instructions sont renvoyées à chaque appel du modèle. Des appels d'outils et rapports minimaux diminuent aussi les tokens de sortie et la croissance de l'historique. Dans le benchmark cité, les préfixes initiaux différaient d'un facteur 12 à 15.

C'est le contexte répété qui engloutit le budget

Je regarderais d'abord non pas la longueur du patch, mais le texte que l'agent transporte pendant tout le cycle. La discussion d'origine sur une tâche cyclique décrit un mode strict : rechercher un bug, émettre une hypothèse, corriger et tester, tandis que l'agent produit surtout des appels d'outils et de courts rapports.

Le détail essentiel est que les instructions d'agents.md sont incluses dans les appels répétés au modèle. Une phrase superflue semble inoffensive une fois, mais elle devient une taxe permanente à chaque nouvelle étape. En parallèle, l'historique grossit et les réponses verbeuses reviennent dans le contexte de l'appel suivant.

L'ampleur du problème apparaît clairement dans le benchmark de préfixes cité. Un agent envoyait de 1 147 à 1 642 tokens avant tout travail substantiel, un autre de 15 983 à 20 330. Cela représente un écart d'environ 12 à 15 fois pour une requête triviale, alors que la tâche n'avait pas réellement commencé.

Une analyse connexe du contexte de dépôt indique également que des fichiers tels qu'AGENTS.md peuvent augmenter le coût d'inférence de plus de 20 % par session, parfois sans amélioration visible du résultat. Ce n'est pas un argument pour supprimer toutes les instructions. Chaque ligne doit plutôt justifier sa présence par son influence sur le comportement de l'agent.

Un cycle court compte davantage qu'un modèle bon marché

Le principal gain ne vient pas du silence en lui-même, mais d'un nombre inférieur de tokens avant d'obtenir un correctif fonctionnel. Un agents.md compact réduit à la fois le préfixe permanent et le risque que l'agent accompagne chaque appel d'outil d'un commentaire inutilement élaboré.

Pour les tâches longues, l'effet s'accumule très vite : les instructions se répètent, l'historique enfle et les résultats de tests ainsi que les plans de patch sont de nouveau envoyés au modèle. Je suivrais donc séparément la taille du contexte initial, le nombre de passages dans la boucle et le volume des rapports intermédiaires. Le coût total de la session est plus utile que celui d'un appel isolé.

Mais une compression excessive peut aussi casser le processus. Si agents.md perd les critères de fin, les règles de test ou les contraintes sur les modifications, l'agent peut effectuer davantage d'itérations erronées et absorber toutes les économies. La véritable optimisation commence lorsqu'un prompt court conserve les contraintes nécessaires, et non lorsqu'il contient simplement moins de mots.

Au final, l'agent de code le moins cher n'est pas celui qui parle le moins, mais celui qui atteint un correctif vérifié avec le minimum de cycles pertinents.

Nous avons déjà analysé comment le coût du contexte et les réglages du mode de raisonnement de Claude Opus 4.6 influencent le prix final des requêtes. Cela complète l'explication de la réduction des tokens grâce à des consignes concises pour les agents.