Cerebras Inference detalla en su documentación oficial el catálogo de modelos disponibles en sus endpoints públicos, así como las técnicas de compresión que aplica —y las que no— a los modelos de código abierto que aloja. La compañía aclara que no ofrece modelos podados (pruned) en sus endpoints compartidos: todas las versiones servidas públicamente son las originales y sin podar, con arquitecturas inalteradas respecto a las publicadas por la comunidad. La cuantización que Cerebras aplica es selectiva y solo durante el almacenamiento, con pesos guardados en precisiones parciales de 16, 8 o 4 bits según los estándares del sector. Las capas sensibles a la calidad se conservan a precisión completa, con dequantización en tiempo de ejecución, mientras que las activaciones, la atención y la caché KV permanecen sin cuantizar y a precisión completa.
El documento incluye además una sección de preguntas frecuentes en la que Cerebras se compromete a no modificar la arquitectura de los modelos existentes sin aviso previo. Si en el futuro explorase nuevas técnicas de compresión, estas se ofrecerían como endpoints independientes con nombres específicos, manteniendo la transparencia para los usuarios. La empresa también explica dónde encontrar sus modelos podados con la técnica REAP (Router-weighted Expert Activation Pruning): están disponibles en Hugging Face como parte de la colección Cerebras REAP, destinada a investigación y experimentación, pero no se sirven a través de la API de producción. Por último, la página diferencia los conceptos de compresión, cuantización y poda, describiendo esta última como la eliminación permanente de partes del modelo —capas o expertos— que altera su arquitectura, frente a la cuantización, que reduce la precisión numérica sin cambiar la estructura.
