En la conferencia Hot Chips 2026, Samsung presentó su nueva tecnología LPDDR5X-PIM (Processing-in-Memory), un avance significativo que integra unidades de cómputo directamente dentro de los paquetes de memoria estándar. El objetivo principal es habilitar la inferencia local de modelos de lenguaje grandes (LLMs) con una eficiencia sin precedentes, superando las limitaciones de ancho de banda tradicionales. Según datos reportados por Ben Houston en ben3d.ca y corroborados por Tom's Hardware, este paquete de 16 GB ofrece un ancho de banda interno de 614 GB/s para sus unidades de cálculo internas, una cifra que equivale al ancho de banda total del sistema de memoria unificada de la Apple M5 Max. En contraste, el ancho de banda expuesto a través de los pines externos es de solo 76.8 GB/s, lo que demuestra una diferencia de ocho veces a favor de la arquitectura PIM.
El cuello de botella histórico en la inferencia de IA local ha sido el ancho de banda de memoria, no la potencia de cálculo pura. Al generar un token, el sistema debe leer todos los parámetros del modelo desde la DRAM; si el ancho de banda es limitado, las unidades de procesamiento permanecen inactivas esperando datos. La arquitectura PIM resuelve esto manteniendo los pesos del modelo dentro del paquete de memoria y realizando las operaciones matemáticas (GEMV) cerca de donde se almacenan los datos. Samsung diseñó dieciséis bloques PIM junto a los bancos de DRAM, utilizando árboles MAC paralelos y una ALU para manejar tipos de datos enteros y de punto flotante. El componente es compatible con el estándar JEDEC de 561 bolas, lo que permite su uso en servidores, dispositivos móviles y clientes sin cambios físicos significativos respecto a la LPDDR5X convencional.
Un aspecto crucial de esta presentación es la compatibilidad. Samsung introdujo el 'Address Align Mode', un mecanismo que permite que los controladores de memoria convencionales utilicen la nueva tecnología sin necesidad de diseñar nuevos controladores específicos para PIM. Esto elimina una barrera de adopción crítica, dejando la integración como un desafío principalmente de software. En pruebas realizadas en su acelerador de IA de borde con el modelo Llama 3.1 8B (contexto de 320 tokens), Samsung demostró que la LPDDR5X-PIM logra un rendimiento de 81.3 tokens por segundo, frente a los 27 tok/s de la LPDDR5X estándar, representando una mejora de 3.01 veces en el throughput y reduciendo el tiempo de ejecución de 12.3 segundos a 5.4 segundos.
Sin embargo, el análisis revela desafíos técnicos significativos para su adopción masiva inmediata. El principal obstáculo es la cuantización. Los formatos populares como los 'k-quants' de llama.cpp (ej. Q4_K_M) utilizan escalas por bloque que requieren lógica generalizada para descuantizar, algo que las unidades MAC mínimas en la DRAM no pueden ejecutar eficientemente debido a las limitaciones de área del diodo. Las investigaciones citadas indican que añadir el hardware necesario para soportar estos formatos complejos podría aumentar el área del diodo en un 126%, reduciendo la densidad de almacenamiento. Por ello, Samsung ofrece actualmente quince combinaciones de precisión uniformes (como SINT4/SINT8), pero no soporta nativamente los formatos GGUF avanzados, lo que requeriría re-cuantización de los modelos existentes.
Desde una perspectiva económica, Samsung argumenta que la memoria ha pasado del 52% al 63% del gasto en componentes de chips de IA entre el primer trimestre de 2024 y el cuarto de 2025. La LPDDR5X-PIM ofrece a los clientes un rendimiento de inferencia comparable al de la HBM (High Bandwidth Memory) pero sin el alto costo, consumo energético o complejidad de empaquetado asociada a esta última. Aunque Samsung no ha revelado precios, la propuesta de valor es clara: democratizar el acceso a ancho de banda masivo para IA local.
En conclusión, la LPDDR5X-PIM demuestra que la arquitectura funciona en silicio real y ofrece un salto cualitativo en el rendimiento por vatio y costo. No obstante, su éxito dependerá de la maduración del ecosistema de software. Hasta que los principales runtimes como llama.cpp o vLLM no implementen backends específicos para PIM y se resuelvan las incompatibilidades con los formatos de cuantización más eficientes, la tecnología permanecerá en un nicho de alto rendimiento pero limitado por la falta de soporte nativo en las herramientas estándar del sector.
