Cerebras presenta el sistema CS-4 con tres obleas WSE-3 Turbo para inferencia de IA a escala

Fuentes: Cerebras unveils CS-4 rack-scale system with three WSE-3 Turbo wafers for hyperscale AI inference

Cerebras ha presentado el CS-4, un sistema a escala de rack basado en su nueva arquitectura Nexus y equipado con tres chips WSE-3 Turbo (WSE-3T). El fabricante afirma que la solución ofrece hasta 30 veces más velocidad de inferencia que los sistemas con GPU y hasta 10 veces más rendimiento por vatio que su antecesor CS-3, además de superar los 1.000 tokens por segundo en modelos de más de 10 billones de parámetros.

El diseño reorganiza el servidor en torno a un Compute Backpack modular que integra la oblea, la conversión de energía, la refrigeración líquida directa, el I/O de alta velocidad y la electrónica de control en un paquete 3D con un 50% menos de componentes. La entrega de potencia se sitúa a 0,5 milímetros del procesador, frente a los ~50 mm de una placa GPU convencional, lo que reduce las pérdidas y duplica la potencia disponible para el WSE-3T.

El nuevo subsistema de I/O programable duplica el ancho de banda y rebaja la latencia entre obleas a 2 microseconds, permitiendo enlazar wafers dentro y entre racks sin necesidad de switch. La plataforma separa la capa de potencia, refrigeración y red (Cerebras PowerRack) de los módulos de cómputo, de forma que la infraestructura se instala y cualifica antes de llegar las obleas, reduciendo el despliegue de días a horas.

Cerebras sitúa el CS-4 como la primera iteración de la arquitectura Nexus y la pieza central de su oferta para centros de datos hyperscale, orientada a cargas de inferencia interactiva sobre modelos frontera.