FrontierHarness измеряет влияние обвязки на AI-агента
FrontierHarnessоценка AI-агентовcoding agents
Что именно измеряет FrontierHarness
Меня здесь цепляет не очередная таблица с баллами моделей, а попытка измерить саму агентную обвязку. Runta в публикации Introducing FrontierHarness Eval сообщает главное: одну модель и одинаковую среду прогнали через 9 production coding harness в 12 конфигурациях. Получилось 360 оценок на 30 задачах.
Набор включает 21 задачу Terminal-Bench и 9 задач DeepSWE, то есть фокус предельно конкретный: разработка ПО и работа в терминале. Результат проверяет детерминированный verifier по схеме pass/fail, а не модель-судья с неизбежной вариативностью. Это делает сравнение проще для интерпретации: задача либо прошла проверку, либо нет.
Среду Runta тоже постаралась зафиксировать. Каждый запуск восстанавливался из golden checkpoint с одинаковыми vCPU, памятью, диском и состоянием среды. Чтения кэша на первом ходе пересчитывались единообразно для всех harness, чтобы сравнение стоимости не зависело от разных правил учета.
На момент анонса итог выглядел так: 209 успешных запусков и 151 провал, общий pass rate составил 58,1%. Claude Code и DSH Creator получили по 63%, а token-weighted cache hit rate по всему полю достиг 92,4%. Для меня ключевой результат не в победителе, а в том, что модель здесь намеренно перестает быть единственной переменной.
Почему одного балла модели уже недостаточно
Практический вывод простой: качество coding-агента нельзя честно выводить только из названия модели. Harness управляет инструментами, контекстом, терминалом и последовательностью действий, поэтому способен менять итог даже при неизменных модели и runtime.
Для разработчиков это дает более полезную точку сравнения агентных стеков. Для исследователей появляется воспроизводимая схема, где инфраструктурный шум хотя бы частично зажат одинаковыми checkpoint и verifier. При этом FrontierHarness уже по охвату, чем lm-evaluation-harness от EleutherAI: он нацелен именно на coding- и terminal-сценарии, а не на широкую оценку языковых моделей.
В сентябре 2026 года я воспринимаю FrontierHarness как хороший инженерный аргумент против слишком простых лидербордов, но не как окончательный рейтинг. Здесь одна модель, 30 задач и конкретный способ исполнения, поэтому переносить 58,1% на другие среды без новой проверки нельзя. Самый интересный вопрос теперь не какая модель сильнее, а какая часть результата вообще принадлежит модели.