Meta Superintelligence Labs lançou Muse Glimmer em 10 de agosto de 2026 — um modelo agentico de 30 bilhões de parâmetros com peso aberto licenciado sob Apache 2.0 e otimizado para rodar inteiramente em hardware de consumidor (24–32 GB de VRAM). O modelo é destilado do modelo de fronteira Muse Spark fechado e inclui recursos multimodais (texto/imagem), chamada de ferramenta e raciocínio de longo horizonte necessários para agentes locais sempre ligados.
Usando quantização de 4 bits, o modelo completo comprime de 55 GB (precisão total) para menos de 20 GB, deixando espaço para memória de trabalho e decodificação especulativa. Meta agrupa decodificação especulativa por bloco DFlash, que consegue aceleração de geração de token de 3.1× em um RTX 5090, 1.8× em um M5 Max e 1.5× em um M4 Max — rápido o suficiente para interação agentica fluida sem chamadas de rede. Pesos estão disponíveis agora no Hugging Face; suporte nativo para llama.cpp, ExecuTorch e vLLM lançando nos próximos dias.
Para arquitetos: isto move IA agentica de apenas nuvem para primeiro local. O modelo de 30B supera Gemma4-31B e Qwen3.6-27B em benchmarks agenticos (MCP-Atlas 75.5 vs. 54.2 e 62.5; DeepSearch QA 74.6 vs. pares nos 50s). Tem desempenho inferior em puras tarefas de terminal/uso de computador mas é projetado para orquestração de ferramentas, codificação e raciocínio. Sinaliza a comoditização de modelos agenticos sub-fronteira e suporta a tese de "superinteligência pessoal" de Zuckerberg.