aiexpert
Inicio / Noticias / Nota
Research · 14 ago 2026, 19:33 · 4 fuentes

Meta Muse Glimmer vs Alibaba Qwen3.8-27B: Benchmarks de Agente Local Compiten

Meta abrió el código de Muse Glimmer el 10 de agosto de 2026, un modelo multimodal denso con 30 mil millones de parámetros destilado de Muse Spark y construido especialmente para flujos de trabajo de agentes locales siempre activos. Lanzado bajo Apache 2.0, el modelo se dirige a sistemas con 24–32 GB de VRAM y se ejecuta en hardware de consumidor sin dependencia de API en la nube. Destaca en finalización de tareas agentivas de extremo a extremo, uso confiable de herramientas, razonamiento multi-paso y recuperación de fallos en marcos que incluyen OpenClaw y MCP.

Muse Glimmer encaja en restricciones de memoria mediante dos optimizaciones: cuantificación dinámica de 4 bits comprime pesos a 17–20 GB, dejando espacio para caché KV e incrustaciones de percepción; y decodificación especulativa DFlash, un modelo redactor ligero que propone bloques de múltiples tokens, ofrece hasta 3.1x aceleración de generación en NVIDIA RTX 5090 (1.8x en M5 Max, 1.5x en M4 Max). Los puntos de referencia muestran fuerte orquestación agentiva en MCP-Atlas (75.5), DeepSearch QA (74.6) y SWE-Bench Pro (51.2), con un borde inferior en trabajo de terminal/uso de computadora donde Qwen3.6-27B lidera (75.6 vs 65.9 en OSWorld).

Días después del lanzamiento de Muse Glimmer, Alibaba lanzó Qwen3.8-27B—también denso, también ~27B parámetros, también Apache 2.0 (por compromiso de Alibaba)—con posicionamiento competitivo directo. En Terminal Bench 2.1, que mide codificación agentiva de terminal, Qwen3.8-27B anota 73.0 vs Muse Glimmer's 51.7, y también lidera en SWE-Bench Pro (61.7), GPQA Diamond (89.2) e IFBench (79.5). Pero Qwen3.8-27B se queda atrás en algunas tareas de razonamiento general donde Muse Glimmer destaca.

Para arquitectos: el nivel modelo local-agentivo abierto ahora está fragmentado por tarea. Muse Glimmer se adapta a orquestación de agentes centrada en razonamiento; Qwen3.8-27B apunta a codificación terminal/nivel de repo y automatización de oficina. Ambos caben en una GPU de consumidor de 24 GB, ambos enviar como pesos abiertos Apache 2.0 y ambos reducen facturación de tokens y latencia vs. APIs en la nube. Este nivel desplaza modelos cerrados más pequeños y obliga a los laboratorios fronterizos a justificar los costos de inferencia en la nube frente a alternativas persistentes ejecutadas localmente. La brecha de puntos de referencia se estrecha mensualmente.

Fuentes

Todo lo que sostiene esta nota
  1. 01 Primary source infoq.com
  2. 02 infoq.com infoq.com “Meta open-sources Muse Glimmer 30B, Apache 2.0, distilled from Muse Spark for always-on local agent workflows”
  3. 03 infoq.com infoq.com “4-bit quantization drops footprint to 17-20 GB; DFlash speculative decoding achieves 3.1x speedup on RTX 5090”
  4. 04 officechai.com officechai.com “Muse Glimmer beats Qwen3.6-27B on agentic tasks; Qwen3.8-27B released same week with Terminal Bench 2.1 at 73.0 vs 51.7”