Cómo afecta agents.md al coste de un agente de código
agents.mdкодовые агентыпромпт-инжиниринг
El contexto repetido es el que consume el presupuesto
Yo miraría primero no la longitud del parche, sino el texto que el agente arrastra durante todo el ciclo. El debate original sobre una tarea cíclica describe un flujo estricto: buscar un error, plantear una hipótesis, corregirlo y probarlo, mientras el agente produce sobre todo llamadas a herramientas e informes breves.
El detalle clave es que las instrucciones de agents.md entran en llamadas repetidas al modelo. Una frase innecesaria parece inofensiva una vez, pero se convierte en un impuesto permanente en cada paso nuevo. Al mismo tiempo, crece el historial y las respuestas extensas vuelven al contexto de la siguiente llamada.
La magnitud del problema se aprecia bien en el benchmark de prefijos citado. Un agente enviaba entre 1.147 y 1.642 tokens antes de realizar trabajo sustancial; otro, entre 15.983 y 20.330. Es una diferencia de aproximadamente 12–15 veces en una petición trivial, cuando la tarea apenas había comenzado.
Un análisis relacionado sobre el contexto del repositorio también indica que archivos como AGENTS.md pueden aumentar el coste de inferencia más de un 20% por sesión, a veces sin una mejora perceptible del resultado. No es un argumento para eliminar por completo las instrucciones. Más bien, cada línea debe justificar su presencia por su efecto sobre el comportamiento del agente.
Un ciclo corto importa más que un modelo barato
La mayor ganancia no procede de que el agente guarde silencio, sino de necesitar menos tokens para llegar a una corrección funcional. Un agents.md compacto reduce a la vez el prefijo permanente y la probabilidad de que el agente acompañe cada llamada a herramienta con un comentario innecesariamente elaborado.
En tareas largas, el efecto se acumula con rapidez: se repiten las instrucciones, se infla el historial y los resultados de pruebas y planes de parche vuelven a enviarse al modelo. Por eso conviene medir por separado el tamaño del contexto inicial, el número de iteraciones y el volumen de informes intermedios. El coste total de la sesión es más útil que el de una sola llamada.
Pero una compresión excesiva también puede romper el trabajo. Si agents.md pierde los criterios de finalización, las reglas de prueba o las restricciones de cambios, el agente puede cometer más iteraciones erróneas y gastar todo el ahorro. La optimización real empieza cuando un prompt corto conserva las restricciones necesarias, no cuando simplemente tiene menos palabras.
En definitiva, el agente de código más barato no es el que menos habla, sino el que alcanza una corrección verificada con el menor número de ciclos útiles.