aiexpert
Início / Notícias / Nota
Research · 10 de ago. de 2026, 20:04 · 5 fontes

Meta abre código-fonte Muse Glimmer, modelo agentico de 30B que roda em GPU de consumidor único

Meta Superintelligence Labs lançou Muse Glimmer em 10 de agosto de 2026 — um modelo agentico de 30 bilhões de parâmetros com peso aberto licenciado sob Apache 2.0 e otimizado para rodar inteiramente em hardware de consumidor (24–32 GB de VRAM). O modelo é destilado do modelo de fronteira Muse Spark fechado e inclui recursos multimodais (texto/imagem), chamada de ferramenta e raciocínio de longo horizonte necessários para agentes locais sempre ligados.

Usando quantização de 4 bits, o modelo completo comprime de 55 GB (precisão total) para menos de 20 GB, deixando espaço para memória de trabalho e decodificação especulativa. Meta agrupa decodificação especulativa por bloco DFlash, que consegue aceleração de geração de token de 3.1× em um RTX 5090, 1.8× em um M5 Max e 1.5× em um M4 Max — rápido o suficiente para interação agentica fluida sem chamadas de rede. Pesos estão disponíveis agora no Hugging Face; suporte nativo para llama.cpp, ExecuTorch e vLLM lançando nos próximos dias.

Para arquitetos: isto move IA agentica de apenas nuvem para primeiro local. O modelo de 30B supera Gemma4-31B e Qwen3.6-27B em benchmarks agenticos (MCP-Atlas 75.5 vs. 54.2 e 62.5; DeepSearch QA 74.6 vs. pares nos 50s). Tem desempenho inferior em puras tarefas de terminal/uso de computador mas é projetado para orquestração de ferramentas, codificação e raciocínio. Sinaliza a comoditização de modelos agenticos sub-fronteira e suporta a tese de "superinteligência pessoal" de Zuckerberg.

Fontes

Tudo que sustenta esta nota
  1. 01 Primary source huggingface.co
  2. 02 huggingface.co huggingface.co “Muse Glimmer is a 30-billion-parameter causal language model with a dedicated perception encoder, distilled from Muse Spark and purpose-built for autonomous agentic tasks on consumer hardware”
  3. 03 opensourceforu.com opensourceforu.com “By applying 4-bit quantization, Meta compressed memory demands from 55 GB to 18–20 GB”
  4. 04 marktechpost.com marktechpost.com “It also leads on DeepSearch QA at 74.6, Gaia2 at 43.3, and SWE-Bench Pro at 51.2”
  5. 05 neowin.net neowin.net “DFlash delivers a 3.1x speedup on an Nvidia RTX 5090, 1.8x on an M5 Max, and 1.5x on an M4 Max”