Empaquetando el razonamiento latente como modelo completo

Fuentes: Packaging Latent Reasoning as a Real Model

DeepSeek-V4-Flash-0731-Latent-Reasoning convierte un adaptador experimental de razonamiento en espacio latente en un modelo autosuficiente listo para producción. El autor publica en HuggingFace un único repositorio con todos los pesos necesarios: el backbone DeepSeek-V4-Flash-0731 cuantizado a NVFP4 sobre los expertos enrutados del MoE (unos 79 GiB por GPU con TP=2), el bloque de decodificación especulativa DSpark preservado y la cabeza de razonamiento latente entrenada, con 35,7 millones de parámetros en un único archivo safetensors de 152 MB. La arquitectura emplea una cabeza de compresión variacional que proyecta el estado oculto de la capa 35 a un latente de 1024 dimensiones y lo reinyecta en el residual, con un factor de compresión de 6 y una cabeza de parada aprendida que decide cuándo terminar el bucle de razonamiento. En la evaluación BBH cot_zeroshot, el modelo alcanza una puntuación agregada de 0,94 ± 0,008 sobre 27 subtareas, con resultados perfectos (1,00) en tareas de seguimiento de estado como tracking_shuffled_objects, formal_fallacies o boolean_expressions y un punto débil claro en dyck_languages (0,26). El autor advierte de que la métrica flexible-extract es la relevante y de que la coincidencia estricta está penalizada porque el modelo no emite la frase literal 'The answer is X'. El servicio se distribuye en dos repositorios GitHub: el addon ds4-reasoning-addon, que registra el driver de bucle cerrado y permanece inactivo hasta fijar la variable de entorno VLLM_DS4_REASONING_CKPT, y un fork de vLLM (vllm-ds4-sm120) imprescindible porque el upstream no puede servir este modelo.