2 хв читання

FrontierHarness вимірює вплив обв’язки на AI-агента

FrontierHarnessоценка AI-агентовcoding agents

Runta представила FrontierHarness Eval — бенчмарк, що відокремлює вплив агентної обв’язки від якості моделі. У версії v1.0 одна модель в ідентичному середовищі виконала 30 coding- і terminal-завдань через дев’ять harness. За результатами 360 оцінок загальний pass rate становив 58,1%, що робить порівняння coding-агентів чеснішим.

Що саме вимірює FrontierHarness

Тут привертає увагу не чергова таблиця з балами моделей, а спроба виміряти саму агентну обв’язку. У публікації Introducing FrontierHarness Eval Runta повідомляє головне: одну модель та ідентичне середовище запустили через дев’ять production coding harness у 12 конфігураціях. У результаті отримали 360 оцінок на 30 завданнях.

Набір містить 21 завдання Terminal-Bench і дев’ять завдань DeepSWE, тобто фокус дуже конкретний: розробка ПЗ та робота в терміналі. Результат перевіряє детермінований verifier за схемою pass/fail, а не модель-суддя з неминучою варіативністю. Це спрощує інтерпретацію: завдання або проходить перевірку, або ні.

Runta також намагалася зафіксувати середовище. Кожен запуск відновлювали з golden checkpoint з однаковими vCPU, пам’яттю, диском і станом середовища. Зчитування кешу на першому ході однаково перераховували для всіх harness, щоб порівняння вартості не залежало від різних правил обліку.

На момент анонсу результат був таким: 209 успішних запусків і 151 невдача, а загальний pass rate становив 58,1%. Claude Code та DSH Creator отримали по 63%, тоді як token-weighted cache hit rate по всьому набору сягнув 92,4%. Головний висновок не в переможці, а в тому, що модель тут навмисно перестає бути єдиною змінною.

Чому одного балу моделі вже недостатньо

Практичний висновок простий: якість coding-агента не можна чесно визначати лише за назвою моделі. Harness керує інструментами, контекстом, терміналом і послідовністю дій, тому здатен змінити результат навіть за незмінних моделі та runtime.

Для розробників це дає кориснішу точку порівняння агентних стеків. Для дослідників з’являється відтворювана схема, де інфраструктурний шум хоча б частково обмежений однаковими checkpoint і verifier. Водночас FrontierHarness вужчий за lm-evaluation-harness від EleutherAI: він націлений на coding- і terminal-сценарії, а не на широку оцінку мовних моделей.

У вересні 2026 року я сприймаю FrontierHarness як сильний інженерний аргумент проти надто спрощених лідербордів, але не як остаточний рейтинг. Тут одна модель, 30 завдань і конкретний спосіб виконання, тому переносити 58,1% на інші середовища без нової перевірки не можна. Найцікавіше питання тепер не в тому, яка модель сильніша, а яка частина результату взагалі належить моделі.

Раніше ми розбирали, як вимірювати надійність LLM-as-a-Judge за допомогою IRT-метрик. Цей підхід доповнює Frontier Harness Eval, коли потрібно оцінити не лише продуктивність моделі, а й стабільність самого механізму перевірки.