Meta abrió el código de Muse Glimmer el 10 de agosto de 2026, un modelo multimodal denso con 30 mil millones de parámetros destilado de Muse Spark y construido especialmente para flujos de trabajo de agentes locales siempre activos. Lanzado bajo Apache 2.0, el modelo se dirige a sistemas con 24–32 GB de VRAM y se ejecuta en hardware de consumidor sin dependencia de API en la nube. Destaca en finalización de tareas agentivas de extremo a extremo, uso confiable de herramientas, razonamiento multi-paso y recuperación de fallos en marcos que incluyen OpenClaw y MCP.
Muse Glimmer encaja en restricciones de memoria mediante dos optimizaciones: cuantificación dinámica de 4 bits comprime pesos a 17–20 GB, dejando espacio para caché KV e incrustaciones de percepción; y decodificación especulativa DFlash, un modelo redactor ligero que propone bloques de múltiples tokens, ofrece hasta 3.1x aceleración de generación en NVIDIA RTX 5090 (1.8x en M5 Max, 1.5x en M4 Max). Los puntos de referencia muestran fuerte orquestación agentiva en MCP-Atlas (75.5), DeepSearch QA (74.6) y SWE-Bench Pro (51.2), con un borde inferior en trabajo de terminal/uso de computadora donde Qwen3.6-27B lidera (75.6 vs 65.9 en OSWorld).
Días después del lanzamiento de Muse Glimmer, Alibaba lanzó Qwen3.8-27B—también denso, también ~27B parámetros, también Apache 2.0 (por compromiso de Alibaba)—con posicionamiento competitivo directo. En Terminal Bench 2.1, que mide codificación agentiva de terminal, Qwen3.8-27B anota 73.0 vs Muse Glimmer's 51.7, y también lidera en SWE-Bench Pro (61.7), GPQA Diamond (89.2) e IFBench (79.5). Pero Qwen3.8-27B se queda atrás en algunas tareas de razonamiento general donde Muse Glimmer destaca.
Para arquitectos: el nivel modelo local-agentivo abierto ahora está fragmentado por tarea. Muse Glimmer se adapta a orquestación de agentes centrada en razonamiento; Qwen3.8-27B apunta a codificación terminal/nivel de repo y automatización de oficina. Ambos caben en una GPU de consumidor de 24 GB, ambos enviar como pesos abiertos Apache 2.0 y ambos reducen facturación de tokens y latencia vs. APIs en la nube. Este nivel desplaza modelos cerrados más pequeños y obliga a los laboratorios fronterizos a justificar los costos de inferencia en la nube frente a alternativas persistentes ejecutadas localmente. La brecha de puntos de referencia se estrecha mensualmente.