d-Matrix presenta Raptor, un acelerador 3D-DRAM para inferencia de IA

Fuentes: d-Matrix unveils Raptor 3D-DRAM accelerator for generative inference

d-Matrix ha presentado en Hot Chips 2026 su acelerador Raptor, un sistema basado en DRAM apilada en tres dimensiones (3D-DRAM) diseñado para resolver los cuellos de botella de ancho de banda y capacidad en la inferencia de modelos de lenguaje de gran escala (LLM). El dispositivo sitúa la memoria directamente sobre los dies de lógica, superando las limitaciones de la SRAM, que ofrece alta velocidad pero baja capacidad, y la HBM, que ofrece gran capacidad pero ancho de banda insuficiente para cargas de trabajo intensivas.

El sistema Raptor utiliza una pila de 36 micras de un die de lógica TSMC N4 sobre un die de DRAM 3D. Su arquitectura permite alcanzar un ancho de banda de 100 TB/s con un consumo energético de 0.37 pJ/bit, una mejora de 13.5 veces respecto a la HBM4. Para gestionar el calor generado por la apilación, d-Matrix emplea refrigeración líquida que mantiene la temperatura del DRAM por debajo de 100 °C. El sistema está optimizado para la fase de decodificación de inferencia, que es el principal consumidor de ancho de banda, permitiendo servir modelos de frontera con 1 millón de tokens de contexto a 1,000 tokens por segundo por usuario. La solución integra corrección de errores y técnicas de enmascaramiento de corriente para mejorar la fiabilidad y el rendimiento en entornos de alta densidad.