Guía para desplegar DeepSeek V4 Flash en producción sobre una AMD MI300X

Fuentes: GitHub - ryanzhou/deepseek-v4-flash-mi300x

El repositorio ryanzhou/deepseek-v4-flash-mi300x reúne la configuración y los parches necesarios para ejecutar el modelo DeepSeek-V4-Flash-0731 (304B parámetros) en producción sobre una única GPU AMD Instinct MI300X. La MI300X dispone de 192 GiB de HBM3 y un ancho de banda de 5,3 TB/s, lo que permite alojar el checkpoint completo en memoria sin cuantización adicional ni descarga por PCIe. Sobre la pila fijada (vLLM ROCm nightly 0.26.1rc1 y AITER 0.1.19) se han medido 168,6 tok/s en decodificación de flujo único, entre 7,9 y 8,5K tok/s en prefill, 542 tok/s agregados con 8 flujos concurrentes y 830 tok/s en ráfagas de 64 flujos, con contexto validado de 256K (la arquitectura soporta 1M).

La documentación explica los problemas de compatibilidad que hubo que resolver: la MI300X (CDNA3) usa la variante fnuz de AMD/Graphcore para E4M3, mientras que MI325X y posteriores adoptan FP8 estándar OCP, lo que puede introducir errores de factor dos en el dominio de escala. El repositorio añade overlays de corrección para el ROCm nightly fijado, una configuración validada con decodificación especulativa DSpark-7 (presupuesto de 2.048 tokens y límite de prefill largo de 1.024), tablas de ajuste AITER para gfx942 y una estrategia híbrida de caché KV (20 GiB en GPU y 96 GiB en CPU).

Se incluyen además un compose.yaml con la pila de producción (vLLM ROCm más Caddy como proxy HTTPS con lista blanca de IP), comprobaciones SHA-256, scripts de arranque y ejemplos de verificación mediante la API OpenAI-compatible. Los requisitos hardware son una MI300X (gfx942, 304 CUs), controlador AMD funcional, Docker Compose reciente, unos 235 GiB de RAM para la caché KV en CPU y aproximadamente 500 GiB de disco para el modelo y caché.