Noticias que mencionan FP8

Qwen publica en open source los pesos cuantizados FP8 de Qwen3.8-2.4T-A95B

El repositorio Qwen/Qwen3.8-2.4T-A95B-FP8 en Hugging Face distribuye los pesos cuantizados en FP8 de un modelo MoE de 2,4 billones de parámetros con 95.000 millones activos, pensado para ejecutarse en vLLM, SGLang, TokenSpeed o mediante Docker. El cuantificado utiliza granularidad fina con bloques d

Guía para desplegar DeepSeek V4 Flash en producción sobre una AMD MI300X

El repositorio ryanzhou/deepseek-v4-flash-mi300x reúne la configuración y los parches necesarios para ejecutar el modelo DeepSeek-V4-Flash-0731 (304B parámetros) en producción sobre una única GPU AMD Instinct MI300X. La MI300X dispone de 192 GiB de HBM3 y un ancho de banda de 5,3 TB/s, lo que permit

INT8 ConvRot: el formato de cuantización que haría innecesario el FP8

INT8 ConvRot es un nuevo método de modelado y cuantización para modelos de IA que llega integrado de forma nativa en ComfyUI a partir de la versión 0.27.0, publicada el 1 de julio de 2026. Se perfila como el nuevo estándar para los modelos cuantizados a 8 bits y está sustituyendo en la práctica a lo

T-Head publica un fork de Triton con backend para sus procesadores PPU

El repositorio t-head/triton-for-sail es un fork del compilador y lenguaje Triton que añade un backend específico para los procesadores PPU desarrollados por T-Head Semiconductor, utilizados en su SDK SAIL. Está pensado para dos generaciones de Tensor Core: PPU0010, con instrucciones MMAv1, y PPU001