2 хв читання

ox-alpha набирає 63% на DeepSWE, але є нюанс

ox-alphaDeepSWEGrok 4.6

Спільнота приписує ox-alpha близько 63% на підмножині DeepSWE за середнього виводу 47K токенів. Це поставило б модель поруч із Grok 4.6, але офіційної картки моделі чи статті, що підтверджує результат і її походження, досі немає.

Що насправді показав ox-alpha

Моя перша реакція тут проста: заявлені 63% на підмножині DeepSWE за середнього виводу 47K токенів виглядають серйозно. Такий результат справді поставив би ox-alpha поруч із сильними закритими моделями для агентної розробки. Але цифра походить з обговорення спільноти, а не з офіційної картки моделі чи статті її розробника.

Станом на 22 серпня 2026 року походження ox-alpha публічно не підтверджено. OpenRouter на сторінці порівняння моделей показує її як безкоштовну stealth-модель із контекстним вікном 1 048 576 токенів. Це конкретні параметри продукту, однак вони нічого не говорять ані про власника ваг, ані про відтворюваність результату DeepSWE.

Для порівняння є надійніша точка відліку: xAI у документації та примітках до релізу Grok 4.6 вказує 65,9% на DeepSWE v1.1. Там само заявлено контекст на 500 тисяч токенів і відсутність ліміту текстового виводу. Отже, розрив із припущеними 63% ox-alpha невеликий, якщо ці вимірювання взагалі зіставні.

Саме тут починається інженерна частина. Результат на підмножині не можна автоматично порівнювати з повною версією DeepSWE v1.1: потрібні склад завдань, налаштування агента, інструменти, кількість спроб і критерій успіху. Середні 47K токенів виводу теж неоднозначні: довга траєкторія може означати наполегливе розв'язання складного завдання, а може приховувати дорогий перебір і слабке планування.

Чому цей сигнал усе одно важливий

Навіть без офіційної верифікації ox-alpha показує напрям: публічно доступні stealth-моделі вже обговорюють на рівні сильних закритих моделей для програмування. Для розробників агентів це змінює перший фільтр вибору: потрібно дивитися не лише на назву лабораторії, а й на стійкість довгих траєкторій із використанням інструментів.

Найбільше виграють сценарії, де великий контекст і тривалий вивід допомагають утримувати репозиторій, історію дій та результати інструментів. Прості рейтинги за однією фінальною цифрою програють: без даних про вартість, затримку та кількість невдалих кроків вони майже не корисні для архітектурного рішення.

Поки що я б назвав 63% сильним непідтвердженим сигналом, а не новою Pareto frontier. Найцікавіша загадка тут навіть не відставання від Grok 4.6, а те, хто створив ox-alpha і якою обчислювальною ціною отримано цю довгу агентну траєкторію.

Раніше ми розглядали Pony Alpha як нову доступну модель для безризикових пілотів і тестування архітектури. Контекст її практичного оцінювання доповнює бенчмарк-результати Ox-alpha та компроміси продуктивності відкритих моделей.