Meta Superintelligence Labs lanza Muse Glimmer, un modelo agentivo de 30.000 millones de parámetros que se ejecuta en local

Fuentes: abstractextraordinary.com, Meta unveils Muse Glimmer, a 30B open-weight agentic model that runs locally on consumer GPUs

Meta Superintelligence Labs ha presentado Muse Glimmer, un modelo de inteligencia artificial de 30.000 millones de parámetros diseñado específicamente para ejecutarse de forma local en dispositivos personales, sin depender de la nube. El modelo ha sido publicado en código abierto bajo una licencia Apache 2.0 y ya está disponible para descarga en Hugging Face, marcando un nuevo paso en la estrategia de Meta de democratizar el acceso a la IA avanzada.

Según la información publicada por el equipo de Meta Superintelligence Labs, Muse Glimmer nace con un objetivo claro: habilitar flujos de trabajo agentivos permanentes en el dispositivo del usuario. A diferencia de los modelos foundation tradicionales, que suelen requerir infraestructura cloud, este modelo ha sido optimizado para correr en un Mac o PC con una sola GPU de consumo, abriendo la puerta a aplicaciones como agentes locales, llamadas a funciones, asistencia de codificación y evaluación de modelos mediante la técnica LLM-as-a-judge.

El entrenamiento del modelo se estructuró en tres fases diferenciadas. En la pre-entrenamiento, Muse Glimmer fue entrenado con las salidas de Muse Spark —el modelo profesor— mediante destilación de logits, utilizando una mezcla de datos similar a la del maestro. La fase de mid-training incorporó datos de mayor contexto y con mayor carga agentiva, incluyendo trazas de razonamiento más ricas. Finalmente, el post-training combinó fine-tuning supervisado con destilación on-policy y aprendizaje por refuerzo en dominios generales, de razonamiento, codificación y agentivos. Meta subraya que el modelo fue evaluado bajo los estándares de su Advanced AI Scaling Framework y revisado para su liberación como pesos abiertos.

En cuanto a capacidades, Muse Glimmer destaca por su habilidad para completar tareas agentivas de extremo a extremo, con tasas de éxito relevantes en benchmarks como DeepSearch QA, MCP-Atlas, τ-Bench y SWE-Bench. El modelo maneja llamadas a funciones con esquemas precisos en flujos extendidos, encadena razonamientos durante horizontes largos y, según Meta, está entrenado para diagnosticar errores y reintentar cuando una herramienta falla, en lugar de detenerse. Además, incorpora un codificador de percepción dedicado que le permite interpretar texto e imágenes intercaladas —capturas de pantalla, gráficos y documentos— y soporta más de 100 idiomas. También es compatible con patrones de orquestación agentiva como OpenClaw y permite ajustar el esfuerzo de razonamiento según el equilibrio deseado entre calidad y velocidad.

Uno de los desafíos técnicos más relevantes fue lograr que un modelo de 30.000 millones de parámetros cupiera en el hardware de consumo. A precisión completa, el modelo requeriría más de 55 GB de memoria, muy por encima de lo que ofrece cualquier GPU de consumo. Meta aplicó técnicas de cuantización para reducir los pesos a aproximadamente 4 bits, llevando el modelo de lenguaje a menos de 20 GB. Esto deja espacio suficiente para la memoria de trabajo (KV cache), el codificador de percepción y el modelo drafter de decodificación especulativa, funcionando simultáneamente dentro de un envolvente de 24 GB o 32 GB. Meta asegura que esta compresión no introduce degradación significativa en tareas agentivas.

La velocidad también fue priorizada. Muse Glimmer incorpora un drafter ligero basado en DFlash, una pequeña red companion que propone bloques completos de tokens a la vez, que el modelo principal verifica en paralelo. Esta decodificación especulativa permite una generación sustancialmente más rápida que la token a token estándar, manteniendo la misma calidad de salida. Meta afirma haber validado el rendimiento en equipos como MacBook M4-Max, M5-Max y tarjetas RTX-5090, donde el modelo es lo suficientemente rápido para conversación fluida e interacción agentiva en tiempo real, todo ejecutándose íntegramente en el dispositivo.

En términos de ecosistema, Muse Glimmer llega con integraciones optimizadas en llama.cpp, MLX y ExecuTorch, y se espera que en los próximos días esté disponible a través de socios como Ollama, LM Studio y Unsloth. Para despliegue a escala, Meta menciona compatibilidades con vLLM y SGLang, y acceso rápido mediante Together AI, Fireworks AI y OpenRouter. La compañía también está colaborando con AMD, Arm, Dell, Intel y NVIDIA para optimizar el rendimiento en distintas arquitecturas, y ha publicado documentación para que los desarrolladores puedan crear y desplegar agentes personales desde el primer día.

Este lanzamiento se inscribe en la larga tradición de Meta de compartir investigación fundamental en IA y refuerza una tendencia creciente en el sector: demostrar que modelos más pequeños, cuando se entrenan de manera eficaz, pueden acercarse al rendimiento de frontera en tareas específicas. Muse Glimmer representa así una apuesta firme por la IA local, privada y siempre disponible, frente al modelo dominante de dependencia cloud.