Nemotron 3.5 Lightning: 30B MoE для агентів
nvidianemotronagentic-ai
Що саме випустила NVIDIA
NVIDIA випустила не чергову майже фронтальну модель, а швидкий виконавчий шар для агентів: Nemotron 3.5 Lightning, відкриту 30B MoE-модель з 3B активних параметрів. В офіційному developer blog NVIDIA та в картці моделі NGC вона описана як модель для high-volume execution у long-running agents.
Сенс MoE тут досить прямий: загальний розмір 30B, але на кроці виведення активні 3B параметрів. Для агентних систем це важливіше, ніж звучить, тому що агент часто витрачає не один великий запит, а сотні дрібних викликів: класифікувати, видобути поле, перевірити стан, виконати вузький крок.
Картка NGC називає архітектуру LatentMoE: гібрид Mamba-2, MoE та Attention. Це цікава суміш саме для виконання, де хочеться не лише якості на окремих завданнях, а й нормальної пропускної здатності на довгих ланцюжках.
На момент анонсу NVIDIA заявляє до 4× швидкості виведення порівняно з моделями схожого розміру. Я би тримав це в голові як vendor claim, а не як незалежний закон фізики: такі числа завжди залежать від заліза, батчингу, довжини контексту та типу завдань.
Найбільш нетипова частина релізу — відкритість пакета. За матеріалами NVIDIA, опубліковано ваги, дані та рецепти під OpenMDW-1.1, а картка NGC окремо говорить про готовність до комерційного використання. Для відкритої агентної інфраструктури це сильніше, ніж просто викласти ваги та зникнути.
Головний зсув не в розумі, а в циклі виконання
Цей реліз змінює розклад не для верхнього планувальника, а для дешевого й частого виконання підзадач. У хабі NVIDIA прямо описано сценарій, де Lightning забирає масове виконання, а сильніші моделі залишаються для складного планування через NeMo Switchyard.
І ось тут стало цікаво: агентна система зазвичай ламається не лише на роздумах, а й на ціні кожного зайвого кроку. Якщо виконавець повільний, агент починає виглядати розумним лише в демо, а в реальному циклі перетворюється на піч для токенів.
Підтримка через OpenClaw, Hermes Agent і стек NeMoClaw показує, що NVIDIA цілиться не в одиночний чат, а в шар рантайму. Це правильна точка удару: спеціалізований виконавець має бути нудним, швидким і передбачуваним.
Що я б перевіряв першим, так це не гарний throughput, а стійкість на однотипних завданнях з помилками стану. 4× швидкість мало допомагає, якщо агент швидше зациклюється на поганому підкроці. Nemotron 3.5 Lightning виглядає як практична цеглина для агентних систем, але головний тест у нього буде не в таблиці бенчмарків, а в довгій брудній петлі виконання.