3 min de lectura

FrontierHarness mide el impacto del harness en un agente de IA

FrontierHarnessоценка AI-агентовcoding agents

Runta presentó FrontierHarness Eval, un benchmark que separa el efecto del harness del agente de la calidad del modelo. En la versión 1.0, un mismo modelo y entorno resolvieron 30 tareas de código y terminal mediante nueve harnesses. Las 360 evaluaciones arrojaron un 58,1% de éxito y permiten comparar agentes con mayor rigor.

Qué mide exactamente FrontierHarness

Lo interesante no es otra tabla de puntuaciones de modelos, sino el intento de medir el propio harness del agente. En la publicación Introducing FrontierHarness Eval, Runta explica el planteamiento central: ejecutó un mismo modelo y un entorno idéntico con nueve harnesses de código en producción y 12 configuraciones. El resultado fueron 360 evaluaciones sobre 30 tareas.

El conjunto incluye 21 tareas de Terminal-Bench y nueve de DeepSWE, con un enfoque muy concreto: desarrollo de software y trabajo en terminal. El resultado lo valida un verificador determinista de aprobado o suspenso, no un modelo juez con variabilidad inevitable. Así, la comparación es más fácil de interpretar: la tarea supera la verificación o no la supera.

Runta también intentó fijar el entorno. Cada ejecución se restauró desde un golden checkpoint con los mismos vCPU, memoria, disco y estado del entorno. Las lecturas de caché del primer turno se recalcularon de forma uniforme para todos los harnesses, evitando que la comparación de costes dependiera de reglas contables distintas.

En el anuncio, el resultado fue de 209 ejecuciones exitosas y 151 fallidas, con una tasa global de éxito del 58,1%. Claude Code y DSH Creator alcanzaron ambos el 63%, mientras que la tasa de aciertos de caché ponderada por tokens llegó al 92,4% en todo el conjunto. La conclusión clave no es quién gana, sino que el modelo deja deliberadamente de ser la única variable.

Por qué ya no basta una puntuación del modelo

La conclusión práctica es sencilla: no se puede deducir con justicia la calidad de un agente de código solo por el nombre del modelo. El harness gestiona herramientas, contexto, terminal y secuencia de acciones, por lo que puede cambiar el resultado incluso cuando el modelo y el runtime no varían.

Para los desarrolladores, esto aporta una forma más útil de comparar stacks de agentes. Para los investigadores, ofrece un esquema reproducible donde el ruido de infraestructura queda parcialmente acotado por checkpoints y verificadores compartidos. FrontierHarness tiene un alcance más estrecho que lm-evaluation-harness de EleutherAI: se centra en escenarios de código y terminal, no en la evaluación general de modelos de lenguaje.

En septiembre de 2026, considero FrontierHarness un buen argumento de ingeniería contra los rankings demasiado simples, pero no una clasificación definitiva. Trabaja con un modelo, 30 tareas y un método de ejecución concreto, por lo que su 58,1% no puede trasladarse a otros entornos sin nuevas pruebas. La cuestión más interesante ya no es qué modelo es mejor, sino qué parte del resultado pertenece realmente al modelo.

Anteriormente analizamos cómo medir la fiabilidad de LLM-as-a-Judge mediante métricas IRT. Este enfoque complementa Frontier Harness Eval cuando se necesita evaluar no solo el rendimiento del modelo, sino también la estabilidad del propio mecanismo de verificación.