MazeBench и ловушка “умных” результатов
ai-agentsbenchmarkreasoning
Что на самом деле показывает MazeBench
MazeBench полезен не тем, что дает еще одну таблицу лидеров, а тем, что вскрывает способ решения. В статье про Maze-Bench-v0.2 авторы описывают бенчмарк из 110 процедурно сгенерированных изображений лабиринтов, разбитых на девять контролируемых групп, и именно эта структура делает результаты интерпретируемыми.
Сама задача выглядит просто: модель должна пройти визуальный лабиринт шаг за шагом. Но по материалам arXiv и датасета Menlo/Maze-Bench-v0.2 на Hugging Face самое интересное не в процентах, а в том, как модель к ним приходит.
Авторы прямо пишут неприятную вещь: высокий score не обязательно означает человеческий стиль визуального планирования. Многие модели, судя по разбору, сначала переводят картинку в текстовую сетку, а потом делают обычный token-level search по этой сетке.
И вот тут бенчмарк становится действительно полезным. Он проверяет не только “решил или нет”, а подталкивает к вопросу, что именно скрывается за правильным ответом.
Почему это важнее очередного процента в таблице
Главный вывод простой: MazeBench бьет по самой удобной иллюзии в агентных системах. Если модель набирает 91%, как указано для GPT-5.4, или 79% для Gemini 3.1 Pro в той же статье, это еще не значит, что она “научилась думать глазами”.
Для инженера это меняет способ чтения бенчмарков. Я бы в первую очередь смотрел не на итоговый score, а на трассу решения: была ли реальная визуальная декомпозиция, где модель теряет структуру, и не сводится ли весь reasoning к скрытому поиску по текстовому представлению.
Отсюда и практическое следствие. Если вы строите агента, который должен ориентироваться в интерфейсе, карте, схеме или кадре из видео, высокий результат на MazeBench сам по себе не гарантирует устойчивое поведение в реальном визуальном мире.
Отдельно нравится, что вокруг MazeBench уже есть не только статья, но и рабочая обвязка. В README проекта visual-thinker он описан как CLI-бенчмарк, а в репозитории Alphamaze-visual-thinker есть примеры запуска оценки моделей. Это хороший сигнал: бенчмарк можно не только цитировать, но и встраивать в реальную проверку пайплайнов.
Сейчас ценность MazeBench не в том, что он окончательно измерил planning. Наоборот: он довольно убедительно показывает, насколько легко перепутать планирование с аккуратным перебором, если смотреть только на красивый финальный score.