2 мин чтения

FrontierHarness измеряет влияние обвязки на AI-агента

FrontierHarnessоценка AI-агентовcoding agents

Runta представила FrontierHarness Eval — бенчмарк, отделяющий влияние агентной обвязки от качества модели. В версии v1.0 одна модель в одинаковой среде решила 30 coding- и terminal-задач через девять harness. По итогам 360 оценок общий pass rate составил 58,1%, что важно для честного сравнения coding-агентов.

Что именно измеряет FrontierHarness

Меня здесь цепляет не очередная таблица с баллами моделей, а попытка измерить саму агентную обвязку. Runta в публикации Introducing FrontierHarness Eval сообщает главное: одну модель и одинаковую среду прогнали через 9 production coding harness в 12 конфигурациях. Получилось 360 оценок на 30 задачах.

Набор включает 21 задачу Terminal-Bench и 9 задач DeepSWE, то есть фокус предельно конкретный: разработка ПО и работа в терминале. Результат проверяет детерминированный verifier по схеме pass/fail, а не модель-судья с неизбежной вариативностью. Это делает сравнение проще для интерпретации: задача либо прошла проверку, либо нет.

Среду Runta тоже постаралась зафиксировать. Каждый запуск восстанавливался из golden checkpoint с одинаковыми vCPU, памятью, диском и состоянием среды. Чтения кэша на первом ходе пересчитывались единообразно для всех harness, чтобы сравнение стоимости не зависело от разных правил учета.

На момент анонса итог выглядел так: 209 успешных запусков и 151 провал, общий pass rate составил 58,1%. Claude Code и DSH Creator получили по 63%, а token-weighted cache hit rate по всему полю достиг 92,4%. Для меня ключевой результат не в победителе, а в том, что модель здесь намеренно перестает быть единственной переменной.

Почему одного балла модели уже недостаточно

Практический вывод простой: качество coding-агента нельзя честно выводить только из названия модели. Harness управляет инструментами, контекстом, терминалом и последовательностью действий, поэтому способен менять итог даже при неизменных модели и runtime.

Для разработчиков это дает более полезную точку сравнения агентных стеков. Для исследователей появляется воспроизводимая схема, где инфраструктурный шум хотя бы частично зажат одинаковыми checkpoint и verifier. При этом FrontierHarness уже по охвату, чем lm-evaluation-harness от EleutherAI: он нацелен именно на coding- и terminal-сценарии, а не на широкую оценку языковых моделей.

В сентябре 2026 года я воспринимаю FrontierHarness как хороший инженерный аргумент против слишком простых лидербордов, но не как окончательный рейтинг. Здесь одна модель, 30 задач и конкретный способ исполнения, поэтому переносить 58,1% на другие среды без новой проверки нельзя. Самый интересный вопрос теперь не какая модель сильнее, а какая часть результата вообще принадлежит модели.

Мы ранее разбирали, как измерять надёжность LLM-as-a-Judge с помощью IRT-метрик. Этот подход дополняет Frontier Harness Eval, когда нужно оценивать не только производительность модели, но и стабильность самого механизма проверки.