Nemotron 3.5 Lightning : 30B MoE pour les agents
nvidianemotronagentic-ai
Ce que NVIDIA a exactement sorti
NVIDIA n'a pas sorti un énième modèle quasi-frontalier, mais une couche d'exécution rapide pour les agents : Nemotron 3.5 Lightning, un modèle MoE ouvert de 30B avec 3B de paramètres actifs. Dans le blog officiel des développeurs NVIDIA et sur la fiche modèle NGC, il est décrit comme un modèle destiné à l'exécution à haut volume dans les agents de longue durée.
Le principe du MoE ici est assez direct : une taille totale de 30B, mais seuls 3B de paramètres sont actifs à chaque étape d'inférence. Pour les systèmes agentifs, c'est plus important qu'il n'y paraît, car un agent ne fait pas une seule grande requête, mais des centaines de petits appels : classer, extraire un champ, vérifier un état, exécuter une étape précise.
La fiche NGC appelle l'architecture LatentMoE : un hybride de Mamba-2, MoE et Attention. C'est un mélange intéressant justement pour l'exécution, où l'on souhaite non seulement de la qualité sur des tâches individuelles, mais aussi un débit correct sur de longues chaînes.
Au moment de l'annonce, NVIDIA revendique jusqu'à 4× la vitesse d'inférence par rapport à des modèles de taille similaire. Je prendrais cela comme une affirmation du fournisseur, pas comme une loi physique indépendante : ces chiffres dépendent toujours du matériel, du batch, de la longueur du contexte et du type de tâches.
La partie la plus inhabituelle de cette sortie est l'ouverture du package. Selon les documents NVIDIA, les poids, les données et les recettes sont publiés sous OpenMDW-1.1, et la fiche NGC mentionne explicitement l'aptitude à un usage commercial. Pour une infrastructure agentive ouverte, c'est plus fort que de simplement balancer les poids et disparaître.
Le principal changement n'est pas dans l'intelligence, mais dans la boucle d'exécution
Cette sortie change la donne non pas pour le planificateur de haut niveau, mais pour l'exécution bon marché et fréquente des sous-tâches. Le hub NVIDIA décrit explicitement un scénario où Lightning prend en charge l'exécution de masse, tandis que les modèles plus puissants restent dédiés à la planification complexe via NeMo Switchyard.
Et là, ça devient intéressant : un système agent ne casse pas seulement sur le raisonnement, mais aussi sur le coût de chaque étape supplémentaire. Si l'exécutant est lent, l'agent ne paraît intelligent que dans les démos, alors qu'en boucle réelle il se transforme en gouffre à tokens.
Le support via OpenClaw, Hermes Agent et la stack NeMoClaw montre que NVIDIA ne vise pas le chat individuel, mais la couche d'exécution. C'est le bon point d'impact : un exécutant spécialisé doit être ennuyeux, rapide et prévisible.
Ce que je vérifierais en premier, ce n'est pas le débit flatteur, mais la stabilité sur des tâches répétitives avec des erreurs d'état. La vitesse 4× n'aide guère si l'agent boucle plus vite sur une mauvaise sous-étape. Nemotron 3.5 Lightning ressemble à une brique pratique pour les systèmes agentifs, mais son vrai test ne sera pas dans un tableau de benchmarks, mais dans une longue et sale boucle d'exécution.