ox-alpha набирає 63% на DeepSWE, але є нюанс
ox-alphaDeepSWEGrok 4.6
Що насправді показав ox-alpha
Моя перша реакція тут проста: заявлені 63% на підмножині DeepSWE за середнього виводу 47K токенів виглядають серйозно. Такий результат справді поставив би ox-alpha поруч із сильними закритими моделями для агентної розробки. Але цифра походить з обговорення спільноти, а не з офіційної картки моделі чи статті її розробника.
Станом на 22 серпня 2026 року походження ox-alpha публічно не підтверджено. OpenRouter на сторінці порівняння моделей показує її як безкоштовну stealth-модель із контекстним вікном 1 048 576 токенів. Це конкретні параметри продукту, однак вони нічого не говорять ані про власника ваг, ані про відтворюваність результату DeepSWE.
Для порівняння є надійніша точка відліку: xAI у документації та примітках до релізу Grok 4.6 вказує 65,9% на DeepSWE v1.1. Там само заявлено контекст на 500 тисяч токенів і відсутність ліміту текстового виводу. Отже, розрив із припущеними 63% ox-alpha невеликий, якщо ці вимірювання взагалі зіставні.
Саме тут починається інженерна частина. Результат на підмножині не можна автоматично порівнювати з повною версією DeepSWE v1.1: потрібні склад завдань, налаштування агента, інструменти, кількість спроб і критерій успіху. Середні 47K токенів виводу теж неоднозначні: довга траєкторія може означати наполегливе розв'язання складного завдання, а може приховувати дорогий перебір і слабке планування.
Чому цей сигнал усе одно важливий
Навіть без офіційної верифікації ox-alpha показує напрям: публічно доступні stealth-моделі вже обговорюють на рівні сильних закритих моделей для програмування. Для розробників агентів це змінює перший фільтр вибору: потрібно дивитися не лише на назву лабораторії, а й на стійкість довгих траєкторій із використанням інструментів.
Найбільше виграють сценарії, де великий контекст і тривалий вивід допомагають утримувати репозиторій, історію дій та результати інструментів. Прості рейтинги за однією фінальною цифрою програють: без даних про вартість, затримку та кількість невдалих кроків вони майже не корисні для архітектурного рішення.
Поки що я б назвав 63% сильним непідтвердженим сигналом, а не новою Pareto frontier. Найцікавіша загадка тут навіть не відставання від Grok 4.6, а те, хто створив ox-alpha і якою обчислювальною ціною отримано цю довгу агентну траєкторію.