Nemotron 3.5 Lightning: 30B MoE для агентов
nvidianemotronagentic-ai
Что именно выпустила NVIDIA
NVIDIA выпустила не очередную почти фронтирную модель, а быстрый исполнительный слой для агентов: Nemotron 3.5 Lightning, открытую 30B MoE-модель с 3B активных параметров. В официальном developer blog NVIDIA и в карточке модели NGC она описана как модель для high-volume execution в long-running agents.
Смысл MoE здесь довольно прямой: общий размер 30B, но на шаге вывода активны 3B параметров. Для агентных систем это важнее, чем звучит, потому что агент часто тратит не один большой запрос, а сотни мелких вызовов: классифицировать, извлечь поле, проверить состояние, выполнить узкий шаг.
Карточка NGC называет архитектуру LatentMoE: гибрид Mamba-2, MoE и Attention. Это интересная смесь именно для исполнения, где хочется не только качества на отдельных задачах, но и нормальной пропускной способности на длинных цепочках.
На момент анонса NVIDIA заявляет до 4× скорости вывода по сравнению с моделями похожего размера. Я бы держал это в голове как vendor claim, а не как независимый закон физики: такие числа всегда зависят от железа, батчинга, длины контекста и типа задач.
Самая нетипичная часть релиза — открытость пакета. По материалам NVIDIA, опубликованы веса, данные и рецепты под OpenMDW-1.1, а карточка NGC отдельно говорит о готовности к коммерческому использованию. Для открытой агентной инфраструктуры это сильнее, чем просто выложить веса и исчезнуть.
Главный сдвиг не в уме, а в цикле исполнения
Этот релиз меняет расклад не для верхнего планировщика, а для дешевого и частого выполнения подзадач. В хабе NVIDIA прямо описан сценарий, где Lightning забирает массовое исполнение, а более сильные модели остаются для сложного планирования через NeMo Switchyard.
И вот тут стало интересно: агентная система обычно ломается не только на рассуждении, но и на цене каждого лишнего шага. Если исполнитель медленный, агент начинает выглядеть умным только в демо, а в реальном цикле превращается в печку для токенов.
Поддержка через OpenClaw, Hermes Agent и стек NeMoClaw показывает, что NVIDIA целится не в одиночный чат, а в слой рантайма. Это правильная точка удара: специализированный исполнитель должен быть скучным, быстрым и предсказуемым.
Что я бы проверял первым, так это не красивый throughput, а устойчивость на однотипных задачах с ошибками состояния. 4× скорость мало помогает, если агент быстрее зацикливается на плохом подшаге. Nemotron 3.5 Lightning выглядит как практичный кирпич для агентных систем, но главный тест у него будет не в таблице бенчмарков, а в длинной грязной петле выполнения.