Meta Superintelligence Labs lanzó Muse Glimmer el 10 de agosto de 2026 — un modelo agentico de 30 mil millones de parámetros con pesos abiertos licenciado bajo Apache 2.0 y optimizado para ejecutarse completamente en hardware de consumidor (24–32 GB de VRAM). El modelo se destila del modelo de frontera cerrado Muse Spark e incluye capacidades multimodales (texto/imagen), llamada de herramientas y razonamiento de largo horizonte necesarios para agentes locales siempre activos.
Con cuantización de 4 bits, el modelo completo se comprime de 55 GB (precisión total) a menos de 20 GB, dejando espacio para memoria de trabajo y decodificación especulativa. Meta agrupa decodificación especulativa por bloque DFlash, que logra aceleración de generación de tokens de 3.1× en un RTX 5090, 1.8× en un M5 Max y 1.5× en un M4 Max — lo suficientemente rápido para interacción agentica fluida sin llamadas de red. Los pesos están disponibles ahora en Hugging Face; soporte nativo para llama.cpp, ExecuTorch y vLLM lanzándose en los próximos días.
Para arquitectos: esto mueve IA agentica de solo nube a local primero. El modelo de 30B supera a Gemma4-31B y Qwen3.6-27B en benchmarks agenticos (MCP-Atlas 75.5 vs. 54.2 y 62.5; DeepSearch QA 74.6 vs. pares en los 50s). Tiene rendimiento inferior en tareas puras de terminal/uso de computadora pero está diseñado para orquestación de herramientas, codificación y razonamiento. Señala la comoditización de modelos agenticos sub-frontera y respalda la tesis de "superinteligencia personal" de Zuckerberg.