3 хв читання

Raptor: 3D-DRAM із пропускною здатністю 100+ ТБ/с

3D-DRAMRaptorAI-инференс

d-Matrix представила Raptor — прискорювач інференсу з 3D-DRAM та обчисленнями в пам'яті. Компанія заявляє понад 100 ТБ/с сукупної пропускної здатності й 0,37 пДж на біт. Це може послабити вузьке місце пам'яті в генеративному ШІ, але доступні цифри походять із матеріалів компанії та Hot Chips 2026.

Що d-Matrix вмістила в Raptor

Тут привертає увагу не лише цифра понад 100 ТБ/с, а й спосіб, яким d-Matrix планує її досягти. В анонсі співпраці з Alchip компанія називає Raptor першим комерційним прискорювачем інференсу для дата-центрів на основі архітектури 3DIMC — тривимірної DRAM з обчисленнями безпосередньо в пам'яті.

Логічний кристал розміщується прямо над спеціалізованою DRAM і з'єднується з нею вертикальними мікроконтактами з кроком 36 мікронів. Таке компонування прибирає традиційний PHY і скорочує шлях даних. Компанія описує конфігурації з кількістю шарів DRAM до чотирьох.

За опублікованими матеріалами про презентацію на Hot Chips 2026, один чиплет Raptor містить близько 4 ГБ DRAM і забезпечує приблизно 12,5 ТБ/с. Сукупна пропускна здатність прискорювача перевищує 100 ТБ/с, а заявлена енергія передавання даних становить близько 0,37 пДж на біт. Це не косметичне прискорення пам'яті, а спроба фізично перебудувати її зв'язок з обчислювальними блоками.

d-Matrix прагне приблизно десятикратної переваги за пропускною здатністю та енергоефективністю порівняно з рішеннями класу HBM4. У висвітленні презентації також фігурують приблизно двадцятикратна перевага над NVIDIA Rubin за пропускною здатністю на одиницю площі та у 13,5 раза менша потужність на переданий гігабайт. Усі ці порівняння наразі походять із матеріалів компанії, а не з незалежного тестування.

Найгучніший сценарій із презентації такий: близько 1000 токенів за секунду на користувача для моделі класу 3T за контексту 1M. Для GLM 5.2 заявлено близько 2121 токена за секунду на користувача за 32 користувачів, для Kimi K3 за тієї самої конкуренції — близько 785. Повідомлена ефективна утилізація пропускної здатності становила 83–85%.

Стіна пам'яті справді може стати нижчою

Якщо заявлені характеристики збережуться в реальних системах, Raptor змінить розклад для інференсу з довгим контекстом і високою конкуренцією запитів. Тут продуктивність часто впирається не в арифметику, а в переміщення ваг і KV-кешу, тому локальна пропускна здатність важливіша за чергове зростання пікової обчислювальної потужності.

Ціна підходу також помітна: спеціалізований прискорювач обмінює універсальність на щільність пропускної здатності та низьку затримку. Насамперед варто дивитися на сталу, а не пікову продуктивність, масштабування між чиплетами та на те, чи дозволяє програмний стек досягати заявленої утилізації на різних моделях.

У зібраних матеріалах немає публічних прикладів коду для Raptor, а основні дані поки стосуються архітектури та презентаційних результатів. Тож 100+ ТБ/с уже виглядає інженерно цікавим, але головне питання не змінилося: яка частка цієї пропускної здатності витримає зустріч із реальними графами моделей та експлуатаційними обмеженнями?

Раніше ми розбирали, як конфіденційні обчислення змінюють інфраструктуру ШІ-інференсу, його вартість і вимоги до приватності. Пам'ять із пропускною здатністю понад 100 ТБ/с доповнює цю картину на апаратному рівні, усуваючи одне з ключових обмежень генеративних моделей.