3 min de lectura

Raptor: 3D-DRAM con más de 100 TB/s de ancho de banda

3D-DRAMRaptorAI-инференс

d-Matrix presentó Raptor, un acelerador de inferencia que combina 3D-DRAM y cómputo en memoria. La empresa afirma superar los 100 TB/s de ancho de banda agregado y alcanzar 0,37 pJ por bit. Puede reducir el cuello de botella de memoria en IA generativa, aunque las cifras aún proceden de la compañía.

Qué ha integrado d-Matrix en Raptor

Lo interesante no es solo la cifra de más de 100 TB/s, sino el método con el que d-Matrix pretende alcanzarla. En el anuncio de su colaboración con Alchip, la empresa presenta Raptor como el primer acelerador comercial de inferencia para centros de datos basado en su arquitectura 3DIMC: DRAM tridimensional con cómputo realizado directamente en memoria.

El chip lógico se coloca directamente sobre DRAM personalizada y se conecta mediante microcontactos verticales con un paso de 36 micras. Esta disposición elimina el PHY tradicional y acorta el recorrido de los datos. La compañía describe configuraciones de hasta cuatro capas de DRAM.

Según los materiales publicados sobre su presentación en Hot Chips 2026, un chiplet Raptor integra cerca de 4 GB de DRAM y ofrece aproximadamente 12,5 TB/s. El ancho de banda agregado del acelerador supera los 100 TB/s y el coste energético declarado para transferir datos es de unos 0,37 pJ por bit. No es una mejora cosmética de memoria, sino un intento de rediseñar físicamente su relación con los bloques de cómputo.

d-Matrix busca una ventaja aproximada de diez veces en ancho de banda y eficiencia energética frente a soluciones de la clase HBM4. La cobertura de la presentación también menciona unas veinte veces más ancho de banda por unidad de área que NVIDIA Rubin y un consumo 13,5 veces menor por gigabyte transferido. Por ahora, todas estas comparaciones proceden de la empresa, no de pruebas independientes.

El escenario más llamativo de la presentación habla de unos 1.000 tokens por segundo por usuario para un modelo de clase 3T con contexto de 1M. Para GLM 5.2 se declaran unos 2.121 tokens por segundo por usuario con 32 usuarios, y para Kimi K3, con la misma concurrencia, unos 785. La utilización efectiva de ancho de banda comunicada fue del 83–85%.

La pared de memoria sí podría bajar

Si las especificaciones anunciadas se mantienen en sistemas reales, Raptor cambia el panorama de la inferencia con contexto largo y alta concurrencia. En estos casos, el rendimiento suele estar limitado menos por la aritmética que por el movimiento de pesos y de la caché KV; por eso el ancho de banda local importa más que otro aumento de potencia de cálculo máxima.

El coste del enfoque también es evidente: un acelerador especializado cambia versatilidad de propósito general por densidad de ancho de banda y baja latencia. Primero miraría el rendimiento sostenido, no el pico; el escalado entre chiplets y la capacidad del stack de software para lograr la utilización anunciada en distintos modelos.

Los materiales recopilados no incluyen ejemplos públicos de código para Raptor, y los datos principales siguen siendo resultados arquitectónicos y de presentación. Por eso, más de 100 TB/s ya resulta interesante desde la ingeniería, pero queda la pregunta clave: qué parte de ese ancho de banda sobrevivirá al contacto con grafos de modelos reales y limitaciones operativas.

Antes analizamos cómo la computación confidencial está transformando la infraestructura de inferencia de IA, sus costes y sus exigencias de privacidad. La memoria con más de 100 TB/s añade una pieza de hardware a ese panorama al eliminar una de las limitaciones clave de los modelos generativos.