Nemotron 3.5 Lightning: 30B MoE para Agentes
nvidianemotronagentic-ai
Qué lanzó exactamente NVIDIA
NVIDIA no lanzó otro modelo casi fronterizo, sino una capa de ejecución rápida para agentes: Nemotron 3.5 Lightning, un modelo MoE abierto de 30B con 3B de parámetros activos. En el blog oficial de desarrollo de NVIDIA y en la ficha del modelo NGC se describe como un modelo para ejecución de alto volumen en agentes de larga duración.
El sentido del MoE aquí es bastante directo: tamaño total de 30B, pero en cada paso de inferencia solo 3B de parámetros están activos. Para sistemas agentivos, esto es más importante de lo que parece, porque un agente a menudo no hace una sola solicitud grande, sino cientos de llamadas pequeñas: clasificar, extraer un campo, verificar estado, ejecutar un paso concreto.
La ficha de NGC denomina la arquitectura LatentMoE: un híbrido de Mamba-2, MoE y Atención. Es una mezcla interesante precisamente para la ejecución, donde se desea no solo calidad en tareas individuales, sino también un rendimiento aceptable en cadenas largas.
En el momento del anuncio, NVIDIA afirma hasta 4× velocidad de inferencia en comparación con modelos de tamaño similar. Yo lo tomaría como una afirmación del proveedor, no como una ley física independiente: esas cifras siempre dependen del hardware, el procesamiento por lotes, la longitud del contexto y el tipo de tarea.
La parte más inusual del lanzamiento es la apertura del paquete. Según los materiales de NVIDIA, se publican pesos, datos y recetas bajo OpenMDW-1.1, y la ficha NGC menciona explícitamente la disponibilidad para uso comercial. Para una infraestructura abierta de agentes, esto es más potente que simplemente soltar los pesos y desaparecer.
El cambio principal no está en la inteligencia, sino en el ciclo de ejecución
Este lanzamiento altera el panorama no para el planificador de alto nivel, sino para la ejecución barata y frecuente de subtareas. En el hub de NVIDIA se describe un escenario donde Lightning se encarga de la ejecución masiva, mientras que los modelos más potentes se reservan para la planificación compleja a través de NeMo Switchyard.
Y aquí se pone interesante: un sistema de agentes no solo se rompe en el razonamiento, sino también en el costo de cada paso adicional. Si el ejecutor es lento, el agente parece inteligente solo en las demostraciones, pero en un ciclo real se convierte en un devorador de tokens.
El soporte a través de OpenClaw, Hermes Agent y la pila NeMoClaw muestra que NVIDIA apunta no al chat individual, sino a la capa de tiempo de ejecución. Es el punto de impacto correcto: un ejecutor especializado debe ser aburrido, rápido y predecible.
Lo primero que comprobaría no es el throughput vistoso, sino la estabilidad en tareas repetitivas con errores de estado. La velocidad 4× sirve de poco si el agente se atasca antes en un subpaso defectuoso. Nemotron 3.5 Lightning parece un ladrillo práctico para sistemas agentivos, pero su prueba principal no estará en una tabla de benchmarks, sino en un largo y sucio bucle de ejecución.