2 мин чтения

MazeBench и ловушка “умных” результатов

ai-agentsbenchmarkreasoning

MazeBench это бенчмарк для оценки решения лабиринтов, пространственного мышления и планирования у AI-агентов. В статье о Maze-Bench-v0.2 обсуждаются 110 изображений лабиринтов в девяти группах, но главный вывод в том, что высокий результат еще не доказывает наличие человеческого визуального планирования. Бенчмарк показывает, как модели могут обманывать, переводя задачу в текстовый поиск.

Что на самом деле показывает MazeBench

MazeBench полезен не тем, что дает еще одну таблицу лидеров, а тем, что вскрывает способ решения. В статье про Maze-Bench-v0.2 авторы описывают бенчмарк из 110 процедурно сгенерированных изображений лабиринтов, разбитых на девять контролируемых групп, и именно эта структура делает результаты интерпретируемыми.

Сама задача выглядит просто: модель должна пройти визуальный лабиринт шаг за шагом. Но по материалам arXiv и датасета Menlo/Maze-Bench-v0.2 на Hugging Face самое интересное не в процентах, а в том, как модель к ним приходит.

Авторы прямо пишут неприятную вещь: высокий score не обязательно означает человеческий стиль визуального планирования. Многие модели, судя по разбору, сначала переводят картинку в текстовую сетку, а потом делают обычный token-level search по этой сетке.

И вот тут бенчмарк становится действительно полезным. Он проверяет не только “решил или нет”, а подталкивает к вопросу, что именно скрывается за правильным ответом.

Почему это важнее очередного процента в таблице

Главный вывод простой: MazeBench бьет по самой удобной иллюзии в агентных системах. Если модель набирает 91%, как указано для GPT-5.4, или 79% для Gemini 3.1 Pro в той же статье, это еще не значит, что она “научилась думать глазами”.

Для инженера это меняет способ чтения бенчмарков. Я бы в первую очередь смотрел не на итоговый score, а на трассу решения: была ли реальная визуальная декомпозиция, где модель теряет структуру, и не сводится ли весь reasoning к скрытому поиску по текстовому представлению.

Отсюда и практическое следствие. Если вы строите агента, который должен ориентироваться в интерфейсе, карте, схеме или кадре из видео, высокий результат на MazeBench сам по себе не гарантирует устойчивое поведение в реальном визуальном мире.

Отдельно нравится, что вокруг MazeBench уже есть не только статья, но и рабочая обвязка. В README проекта visual-thinker он описан как CLI-бенчмарк, а в репозитории Alphamaze-visual-thinker есть примеры запуска оценки моделей. Это хороший сигнал: бенчмарк можно не только цитировать, но и встраивать в реальную проверку пайплайнов.

Сейчас ценность MazeBench не в том, что он окончательно измерил planning. Наоборот: он довольно убедительно показывает, насколько легко перепутать планирование с аккуратным перебором, если смотреть только на красивый финальный score.

Мы ранее разбирали, как измерять надёжность LLM-судей с помощью IRT-метрик. Этот подход к оценке качества моделей пересекается с тем, как MazeBench тестирует способности AI в пространственных задачах.