2 мин чтения

ox-alpha набирает 63% на DeepSWE, но есть нюанс

ox-alphaDeepSWEGrok 4.6

В сообществе ox-alpha приписывают около 63% на подмножестве DeepSWE при среднем выводе 47K токенов, что ставит модель рядом с Grok 4.6. Но официальной карточки или статьи, подтверждающей результат и происхождение модели, нет. Поэтому это сильный сигнал для coding-агентов, а не установленный рекорд.

Что на самом деле показал ox-alpha

У меня здесь первая реакция простая: заявленные 63% на подмножестве DeepSWE при среднем выводе 47K токенов выглядят серьезно. Такой результат действительно поставил бы ox-alpha рядом с сильными закрытыми моделями для агентной разработки. Но цифра пришла из обсуждения сообщества, а не из официальной карточки модели или статьи разработчика.

По состоянию на 22 августа 2026 года происхождение ox-alpha публично не подтверждено. OpenRouter на странице сравнения моделей показывает ее как бесплатную stealth-модель с контекстным окном 1 048 576 токенов. Это конкретные продуктовые параметры, однако они ничего не говорят ни о владельце весов, ни о воспроизводимости результата DeepSWE.

Для сравнения есть более твердая точка: xAI в документации и примечаниях к выпуску Grok 4.6 указывает 65,9% на DeepSWE v1.1. Там же заявлены контекст на 500 тысяч токенов и отсутствие лимита текстового вывода. То есть разрыв с предполагаемыми 63% ox-alpha небольшой, если измерения вообще сопоставимы.

И вот здесь начинается инженерная часть. Результат на подмножестве нельзя автоматически сравнивать с полной версией DeepSWE v1.1: нужны состав задач, настройки агента, инструменты, число попыток и критерий успеха. Средние 47K выходных токенов тоже двусмысленны: длинная траектория может означать настойчивое решение сложной задачи, а может скрывать дорогой перебор и слабое планирование.

Почему этот сигнал все равно важен

Даже без официальной верификации ox-alpha показывает направление: публично доступные stealth-модели уже обсуждаются на уровне сильных закрытых coding-моделей. Для разработчиков агентов это меняет первый фильтр выбора: смотреть приходится не только на имя лаборатории, но и на устойчивость длинных инструментальных траекторий.

Выигрывают сценарии, где большой контекст и продолжительный вывод помогают удерживать репозиторий, историю действий и результаты инструментов. Проигрывают простые рейтинги по одной итоговой цифре: без данных о стоимости, задержке и числе неудачных шагов они почти бесполезны для архитектурного решения.

Я бы пока называл 63% сильным неподтвержденным сигналом, а не новым Pareto frontier. Самая интересная загадка здесь даже не отставание от Grok 4.6, а то, кто создал ox-alpha и какой вычислительной ценой получена эта длинная агентная траектория.

Ранее мы разбирали Pony Alpha как новую доступную модель для пилотирования без риска и тестирования архитектур. Контекст её практической оценки дополняет результаты Ox-alpha на бенчмарке и компромиссы производительности открытых моделей.