3 хв читання

Nemotron 3.5 Lightning: 30B MoE для агентів

nvidianemotronagentic-ai

NVIDIA випустила Nemotron 3.5 Lightning, відкриту 30B MoE-модель з 3B активних параметрів для виконавчого рівня довгоживучих агентів. NVIDIA заявляє до 4× швидкості виведення, публікуючи ваги, дані та рецепти під OpenMDW-1.1. Це ставка на масове виконання спеціалізованих завдань, а не на планування.

Що саме випустила NVIDIA

NVIDIA випустила не чергову майже фронтальну модель, а швидкий виконавчий шар для агентів: Nemotron 3.5 Lightning, відкриту 30B MoE-модель з 3B активних параметрів. В офіційному developer blog NVIDIA та в картці моделі NGC вона описана як модель для high-volume execution у long-running agents.

Сенс MoE тут досить прямий: загальний розмір 30B, але на кроці виведення активні 3B параметрів. Для агентних систем це важливіше, ніж звучить, тому що агент часто витрачає не один великий запит, а сотні дрібних викликів: класифікувати, видобути поле, перевірити стан, виконати вузький крок.

Картка NGC називає архітектуру LatentMoE: гібрид Mamba-2, MoE та Attention. Це цікава суміш саме для виконання, де хочеться не лише якості на окремих завданнях, а й нормальної пропускної здатності на довгих ланцюжках.

На момент анонсу NVIDIA заявляє до 4× швидкості виведення порівняно з моделями схожого розміру. Я би тримав це в голові як vendor claim, а не як незалежний закон фізики: такі числа завжди залежать від заліза, батчингу, довжини контексту та типу завдань.

Найбільш нетипова частина релізу — відкритість пакета. За матеріалами NVIDIA, опубліковано ваги, дані та рецепти під OpenMDW-1.1, а картка NGC окремо говорить про готовність до комерційного використання. Для відкритої агентної інфраструктури це сильніше, ніж просто викласти ваги та зникнути.

Головний зсув не в розумі, а в циклі виконання

Цей реліз змінює розклад не для верхнього планувальника, а для дешевого й частого виконання підзадач. У хабі NVIDIA прямо описано сценарій, де Lightning забирає масове виконання, а сильніші моделі залишаються для складного планування через NeMo Switchyard.

І ось тут стало цікаво: агентна система зазвичай ламається не лише на роздумах, а й на ціні кожного зайвого кроку. Якщо виконавець повільний, агент починає виглядати розумним лише в демо, а в реальному циклі перетворюється на піч для токенів.

Підтримка через OpenClaw, Hermes Agent і стек NeMoClaw показує, що NVIDIA цілиться не в одиночний чат, а в шар рантайму. Це правильна точка удару: спеціалізований виконавець має бути нудним, швидким і передбачуваним.

Що я б перевіряв першим, так це не гарний throughput, а стійкість на однотипних завданнях з помилками стану. 4× швидкість мало допомагає, якщо агент швидше зациклюється на поганому підкроці. Nemotron 3.5 Lightning виглядає як практична цеглина для агентних систем, але головний тест у нього буде не в таблиці бенчмарків, а в довгій брудній петлі виконання.

Раніше ми аналізували графіки продуктивності та контекстні витрати Claude Opus 4.6. Тепер на прикладі відкритої MoE-архітектури Nemotron 3.5 Lightning ці компроміси стають особливо наочними — модель досягає чотирикратного прискорення, зберігаючи 30 мільярдів параметрів.