Meta lançou Muse Spark 1.2 em 5 de agosto de 2026, uma atualização focada em codificação enviada junto com Muse Code, o primeiro agente de codificação de terminal do Meta. Em benchmarks independentes, Muse Spark 1.2 pontua 54 no Índice de Inteligência da Artificial Analysis em configuração xhigh, colocando-o empatado com Grok 4.5 e pouco atrás de Opus 5 (61), Fable 5 (60) e GPT-5.6 Sol (59)—um ganho de 3 pontos em relação a Muse Spark 1.1 (51) e 11 pontos em relação ao Muse Spark original (43 em abril).
Nos próprios benchmarks internos do Meta, o modelo atingiu 82,9% no Terminal-Bench 2.1 (acima do 76,2% do 1.1) e 59,3% no DeepSWE v1.1. Meta também alegou desempenho de nível medalha de ouro em cinco Olimpíadas STEM: pontuações perfeitas na Olimpíada de Física Asiática (APhO) e Olimpíada de Física Internacional (IPhO) em provas teóricas, além de medalhas de ouro na Olimpíada Matemática Internacional (IMO), Olimpíada de Química Internacional (IChO) e Mestres Romenos de Matemática (RMM). Três competições usaram julgamento ao vivo oficial sem ferramentas permitidas—apenas pura raciocínio através de orquestração multi-agente.
No índice de preços de Vals, Muse Spark 1.2 entrou no top 5 a $0,69/teste, reportedly 3x mais barato que Kimi e 10x+ mais barato que Fable, Opus e GPT-5.6 Sol. Vals também relatou que se tornou o primeiro modelo acima de 60% em Finance Agent v2 a $0,77/teste (versus Opus 5 a $5,12/teste) enquanto executava 2x a velocidade. Muse Spark 1.2 mantém preços de API padrão de $1,25 por milhão de tokens de entrada e $4,25 por milhão de tokens de saída, inalterados em relação ao 1.1. Meta também oferece um nível de contribuidor 12,5x mais barato em entrada e 21,25x mais barato em saída em troca de consentimento de dados de treinamento.
Para arquitetos, Muse Spark 1.2 sinaliza que o cadence de lançamento de quatro semanas do Meta está superando o ecossistema de avaliação—ainda não há breakdown de benchmark publicado por teste para 1.2. Os resultados da Olimpíada dependem de orquestração multi-agente e rejection sampling, não apenas escala de modelo bruto, sugerindo que o caminho para desempenho de fronteira cada vez mais passa por harnesses e TTC (time-to-completion), não apenas pesos de modelo. O delta de preço-para-desempenho importa para cargas de trabalho agentic sensíveis a custos, especialmente se a configuração Finance Agent v2 (2x velocidade com 1/7 do custo) se mantiver em produção.