ox-alpha logra un 63% en DeepSWE, pero hay un matiz
ox-alphaDeepSWEGrok 4.6
Qué mostró realmente ox-alpha
Mi primera reacción es sencilla: el 63% atribuido a ox-alpha en un subconjunto de DeepSWE, con una salida media de 47K tokens, parece un resultado serio. De confirmarse, situaría al modelo junto a modelos cerrados potentes para desarrollo de software con agentes. Sin embargo, la cifra procede de conversaciones de la comunidad, no de una tarjeta oficial del modelo ni de un artículo de su desarrollador.
A fecha del 22 de agosto de 2026, el origen de ox-alpha no ha sido confirmado públicamente. OpenRouter lo muestra en su página de comparación como un modelo stealth gratuito con una ventana de contexto de 1.048.576 tokens. Son parámetros concretos del producto, pero no revelan quién posee los pesos ni si el resultado de DeepSWE puede reproducirse.
Hay un punto de comparación más sólido: xAI indica en la documentación y las notas de lanzamiento de Grok 4.6 un 65,9% en DeepSWE v1.1. También declara un contexto de 500.000 tokens y ausencia de límite para la salida de texto. La distancia respecto al 63% atribuido a ox-alpha sería pequeña, siempre que las mediciones sean realmente comparables.
Aquí empieza la parte de ingeniería. Un resultado en un subconjunto no puede compararse automáticamente con la versión completa de DeepSWE v1.1: hacen falta la composición de tareas, la configuración del agente, las herramientas, el número de intentos y el criterio de éxito. Los 47K tokens medios de salida también son ambiguos: una trayectoria larga puede reflejar perseverancia ante una tarea difícil, o esconder ensayo y error costoso y una planificación débil.
Por qué esta señal sigue siendo importante
Incluso sin verificación oficial, ox-alpha apunta a una tendencia: modelos stealth disponibles públicamente ya se comentan al nivel de modelos cerrados fuertes para programación. Para quienes desarrollan agentes, esto cambia el primer filtro de selección. Ya no basta con mirar el nombre del laboratorio; importa la capacidad de sostener trayectorias largas con herramientas.
Los escenarios que más ganan son aquellos en los que un gran contexto y una salida prolongada ayudan a mantener el repositorio, el historial de acciones y los resultados de las herramientas. Las clasificaciones basadas en una sola cifra final pierden valor: sin datos de coste, latencia y pasos fallidos, apenas sirven para tomar una decisión de arquitectura.
Por ahora, llamaría al 63% una señal fuerte pero no verificada, no una nueva frontera de Pareto. El misterio más interesante ni siquiera es la aparente distancia con Grok 4.6, sino quién creó ox-alpha y qué coste computacional exigió esa larga trayectoria del agente.