FrontierHarness вимірює вплив обв’язки на AI-агента
FrontierHarnessоценка AI-агентовcoding agents
Що саме вимірює FrontierHarness
Тут привертає увагу не чергова таблиця з балами моделей, а спроба виміряти саму агентну обв’язку. У публікації Introducing FrontierHarness Eval Runta повідомляє головне: одну модель та ідентичне середовище запустили через дев’ять production coding harness у 12 конфігураціях. У результаті отримали 360 оцінок на 30 завданнях.
Набір містить 21 завдання Terminal-Bench і дев’ять завдань DeepSWE, тобто фокус дуже конкретний: розробка ПЗ та робота в терміналі. Результат перевіряє детермінований verifier за схемою pass/fail, а не модель-суддя з неминучою варіативністю. Це спрощує інтерпретацію: завдання або проходить перевірку, або ні.
Runta також намагалася зафіксувати середовище. Кожен запуск відновлювали з golden checkpoint з однаковими vCPU, пам’яттю, диском і станом середовища. Зчитування кешу на першому ході однаково перераховували для всіх harness, щоб порівняння вартості не залежало від різних правил обліку.
На момент анонсу результат був таким: 209 успішних запусків і 151 невдача, а загальний pass rate становив 58,1%. Claude Code та DSH Creator отримали по 63%, тоді як token-weighted cache hit rate по всьому набору сягнув 92,4%. Головний висновок не в переможці, а в тому, що модель тут навмисно перестає бути єдиною змінною.
Чому одного балу моделі вже недостатньо
Практичний висновок простий: якість coding-агента не можна чесно визначати лише за назвою моделі. Harness керує інструментами, контекстом, терміналом і послідовністю дій, тому здатен змінити результат навіть за незмінних моделі та runtime.
Для розробників це дає кориснішу точку порівняння агентних стеків. Для дослідників з’являється відтворювана схема, де інфраструктурний шум хоча б частково обмежений однаковими checkpoint і verifier. Водночас FrontierHarness вужчий за lm-evaluation-harness від EleutherAI: він націлений на coding- і terminal-сценарії, а не на широку оцінку мовних моделей.
У вересні 2026 року я сприймаю FrontierHarness як сильний інженерний аргумент проти надто спрощених лідербордів, але не як остаточний рейтинг. Тут одна модель, 30 завдань і конкретний спосіб виконання, тому переносити 58,1% на інші середовища без нової перевірки не можна. Найцікавіше питання тепер не в тому, яка модель сильніша, а яка частина результату взагалі належить моделі.