3 мин чтения

Raptor: 3D-DRAM с пропускной способностью 100+ ТБ/с

3D-DRAMRaptorAI-инференс

d-Matrix представила Raptor — ускоритель инференса с 3D-DRAM и вычислениями в памяти. Компания заявляет свыше 100 ТБ/с совокупной пропускной способности и 0,37 пДж на бит. Архитектура может ослабить узкое место памяти в генеративном ИИ, но доступные показатели основаны на материалах компании и освещении Hot Chips 2026.

Что d-Matrix уложила в Raptor

Меня здесь цепляет не только цифра свыше 100 ТБ/с, а способ, которым d-Matrix собирается ее получить. В анонсе сотрудничества с Alchip компания называет Raptor первым коммерческим ускорителем инференса для дата-центров на основе своей архитектуры 3DIMC, то есть трехмерной DRAM с вычислениями непосредственно в памяти.

Логический кристалл размещается прямо над заказной DRAM и соединяется с ней вертикальными микроконтактами с шагом 36 микрон. Такая компоновка убирает традиционный PHY и сокращает путь данных. Компания описывает конфигурацию с количеством слоев DRAM до четырех.

По опубликованным материалам о презентации на Hot Chips 2026, один чиплет Raptor содержит около 4 ГБ DRAM и обеспечивает примерно 12,5 ТБ/с. Совокупная полоса ускорителя превышает 100 ТБ/с, а заявленная стоимость передачи данных составляет около 0,37 пДж на бит. Это не косметическое ускорение памяти, а попытка физически перестроить ее связь с вычислительными блоками.

d-Matrix ставит целью примерно десятикратное преимущество по пропускной способности и энергоэффективности относительно решений класса HBM4. В освещении презентации также фигурируют примерно двадцатикратное преимущество над NVIDIA Rubin по полосе на единицу площади и в 13,5 раза меньшая мощность на переданный гигабайт. Все эти сравнения пока исходят из материалов компании, а не из независимого тестирования.

Самый громкий сценарий из презентации выглядит так: около 1000 токенов в секунду на пользователя для модели класса 3T при контексте 1M. Для GLM 5.2 заявлено около 2121 токена в секунду на пользователя при 32 пользователях, для Kimi K3 при той же конкуренции около 785. Сообщавшаяся эффективная утилизация полосы составляла 83–85%.

Стена памяти действительно становится ниже

Если заявленные характеристики сохранятся в реальных системах, Raptor меняет расклад для инференса с длинным контекстом и высокой конкуренцией запросов. Здесь производительность часто упирается не в арифметику, а в перемещение весов и KV-кэша, поэтому локальная полоса важнее очередного роста пиковой вычислительной мощности.

Цена подхода тоже видна: специализированный ускоритель меняет универсальность на плотность полосы и низкую задержку. Я бы в первую очередь смотрел на устойчивую, а не пиковую производительность, масштабирование между чиплетами и то, насколько программный стек позволяет получать заявленную утилизацию на разных моделях.

Публичных примеров кода для Raptor в собранных материалах нет, а основные данные пока относятся к архитектуре и презентационным результатам. Поэтому 100+ ТБ/с уже выглядит инженерно интересно, но главный вопрос остается прежним: какая доля этой полосы переживет встречу с реальными графами моделей и эксплуатационными ограничениями.

Мы ранее разбирали, как конфиденциальные вычисления меняют инфраструктуру ИИ-инференса, его стоимость и требования к приватности. Память с пропускной способностью свыше 100 ТБ/с дополняет эту картину на аппаратном уровне, устраняя одно из ключевых ограничений генеративных моделей.