Codex 6 Sol: el razonamiento Ultra llega a la CLI
Codex 6 SolCodex CLIreasoning models
Ultra en la CLI es más que razonamiento reforzado
Lo llamativo no es otro interruptor, sino un cambio en la mecánica de trabajo: Codex 6 Sol incorpora seis niveles de razonamiento directamente en la CLI. La documentación oficial de OpenAI para GPT-6 Sol enumera Low, Medium, High, Extra high, Max y Ultra. A fecha del 23 de septiembre de 2026, Medium figura como opción predeterminada.
La documentación de OpenAI sobre la API de razonamiento distingue entre el modo de razonamiento y el esfuerzo de razonamiento. Por tanto, elegir un modelo no implica por sí mismo la máxima profundidad de procesamiento, y no configurar ese parámetro deja el nivel medio. Es un detalle relevante para la configuración y la reproducibilidad: la misma solicitud al mismo modelo puede ejecutarse con distinto presupuesto de razonamiento.
Lo más interesante comienza en Ultra. Este nivel se describe como razonamiento máximo con delegación automática de tareas, por lo que ya no se trata solo de una búsqueda interna más larga para encontrar una respuesta. En la práctica, se acerca más a un circuito multiagente integrado, donde el modelo principal puede repartir partes del trabajo entre subtareas.
La primera señal de la función llegó a partir de observaciones de usuarios de Codex CLI, mientras que la documentación explica qué hay detrás de la nueva opción de interfaz. Sin embargo, no revela los detalles de la orquestación: cuántas subtareas se crean, cómo se transmite el contexto entre ellas o cómo se compone el resultado final.
Las tareas complejas cambian el propio flujo de trabajo
El cambio práctico es sencillo: ahora el desarrollador elige no solo el modelo, sino también la forma de cómputo aplicada a una tarea. Medium parece el modo base para el código cotidiano, mientras que High, Max y Ultra se orientan a depuración más difícil y trabajo de varios pasos en un repositorio.
Yo miraría antes el coste de coordinación que la etiqueta Ultra. La delegación automática puede mejorar la descomposición, pero también introduce trabajo duplicado, mayor consumo de contexto y errores al combinar resultados parciales. Sin trazabilidad transparente, es difícil saber si el modelo dividió la tarea con criterio o simplemente generó más cómputo.
No es una actualización cosmética vacía: el razonamiento pasa gradualmente a formar parte de la interfaz habitual del desarrollador, en vez de ser un parámetro oculto de API. Sin embargo, el valor real de Ultra dependerá menos de la profundidad máxima que de la fiabilidad con la que Codex coordine sus propias subtareas. Ahí está la frontera entre un modo agéntico útil y una costosa ilusión de actividad.