3 мин чтения

Nemotron 3.5 Lightning: 30B MoE для агентов

nvidianemotronagentic-ai

NVIDIA выпустила Nemotron 3.5 Lightning, открытую 30B MoE-модель с 3B активных параметров для исполнительного слоя долгоживущих агентов. В материалах NVIDIA заявлены до 4× скорости вывода, публикация весов, данных и рецептов под OpenMDW-1.1. Это ставка не на планирование, а на массовое выполнение специализированных задач.

Что именно выпустила NVIDIA

NVIDIA выпустила не очередную почти фронтирную модель, а быстрый исполнительный слой для агентов: Nemotron 3.5 Lightning, открытую 30B MoE-модель с 3B активных параметров. В официальном developer blog NVIDIA и в карточке модели NGC она описана как модель для high-volume execution в long-running agents.

Смысл MoE здесь довольно прямой: общий размер 30B, но на шаге вывода активны 3B параметров. Для агентных систем это важнее, чем звучит, потому что агент часто тратит не один большой запрос, а сотни мелких вызовов: классифицировать, извлечь поле, проверить состояние, выполнить узкий шаг.

Карточка NGC называет архитектуру LatentMoE: гибрид Mamba-2, MoE и Attention. Это интересная смесь именно для исполнения, где хочется не только качества на отдельных задачах, но и нормальной пропускной способности на длинных цепочках.

На момент анонса NVIDIA заявляет до 4× скорости вывода по сравнению с моделями похожего размера. Я бы держал это в голове как vendor claim, а не как независимый закон физики: такие числа всегда зависят от железа, батчинга, длины контекста и типа задач.

Самая нетипичная часть релиза — открытость пакета. По материалам NVIDIA, опубликованы веса, данные и рецепты под OpenMDW-1.1, а карточка NGC отдельно говорит о готовности к коммерческому использованию. Для открытой агентной инфраструктуры это сильнее, чем просто выложить веса и исчезнуть.

Главный сдвиг не в уме, а в цикле исполнения

Этот релиз меняет расклад не для верхнего планировщика, а для дешевого и частого выполнения подзадач. В хабе NVIDIA прямо описан сценарий, где Lightning забирает массовое исполнение, а более сильные модели остаются для сложного планирования через NeMo Switchyard.

И вот тут стало интересно: агентная система обычно ломается не только на рассуждении, но и на цене каждого лишнего шага. Если исполнитель медленный, агент начинает выглядеть умным только в демо, а в реальном цикле превращается в печку для токенов.

Поддержка через OpenClaw, Hermes Agent и стек NeMoClaw показывает, что NVIDIA целится не в одиночный чат, а в слой рантайма. Это правильная точка удара: специализированный исполнитель должен быть скучным, быстрым и предсказуемым.

Что я бы проверял первым, так это не красивый throughput, а устойчивость на однотипных задачах с ошибками состояния. 4× скорость мало помогает, если агент быстрее зацикливается на плохом подшаге. Nemotron 3.5 Lightning выглядит как практичный кирпич для агентных систем, но главный тест у него будет не в таблице бенчмарков, а в длинной грязной петле выполнения.

Ранее мы разбирали графики производительности и контекстных издержек Claude Opus 4.6. Теперь, на примере открытой MoE‑архитектуры Nemotron 3.5 Lightning, эти компромиссы становятся особенно наглядными — модель достигает четырёхкратного ускорения, сохраняя 30 миллиардов параметров.