aiexpert
Início / Notícias / Nota
Research · 09 de ago. de 2026, 02:32 · 4 fontes

Meta Muse Spark 1.2 vence cinco ouros em Olimpíadas STEM, atinge $0.69/teste em Vals Index

Meta lançou Muse Spark 1.2 em 5 de agosto de 2026, uma atualização focada em codificação enviada junto com Muse Code, o primeiro agente de codificação de terminal do Meta. Em benchmarks independentes, Muse Spark 1.2 pontua 54 no Índice de Inteligência da Artificial Analysis em configuração xhigh, colocando-o empatado com Grok 4.5 e pouco atrás de Opus 5 (61), Fable 5 (60) e GPT-5.6 Sol (59)—um ganho de 3 pontos em relação a Muse Spark 1.1 (51) e 11 pontos em relação ao Muse Spark original (43 em abril).

Nos próprios benchmarks internos do Meta, o modelo atingiu 82,9% no Terminal-Bench 2.1 (acima do 76,2% do 1.1) e 59,3% no DeepSWE v1.1. Meta também alegou desempenho de nível medalha de ouro em cinco Olimpíadas STEM: pontuações perfeitas na Olimpíada de Física Asiática (APhO) e Olimpíada de Física Internacional (IPhO) em provas teóricas, além de medalhas de ouro na Olimpíada Matemática Internacional (IMO), Olimpíada de Química Internacional (IChO) e Mestres Romenos de Matemática (RMM). Três competições usaram julgamento ao vivo oficial sem ferramentas permitidas—apenas pura raciocínio através de orquestração multi-agente.

No índice de preços de Vals, Muse Spark 1.2 entrou no top 5 a $0,69/teste, reportedly 3x mais barato que Kimi e 10x+ mais barato que Fable, Opus e GPT-5.6 Sol. Vals também relatou que se tornou o primeiro modelo acima de 60% em Finance Agent v2 a $0,77/teste (versus Opus 5 a $5,12/teste) enquanto executava 2x a velocidade. Muse Spark 1.2 mantém preços de API padrão de $1,25 por milhão de tokens de entrada e $4,25 por milhão de tokens de saída, inalterados em relação ao 1.1. Meta também oferece um nível de contribuidor 12,5x mais barato em entrada e 21,25x mais barato em saída em troca de consentimento de dados de treinamento.

Para arquitetos, Muse Spark 1.2 sinaliza que o cadence de lançamento de quatro semanas do Meta está superando o ecossistema de avaliação—ainda não há breakdown de benchmark publicado por teste para 1.2. Os resultados da Olimpíada dependem de orquestração multi-agente e rejection sampling, não apenas escala de modelo bruto, sugerindo que o caminho para desempenho de fronteira cada vez mais passa por harnesses e TTC (time-to-completion), não apenas pesos de modelo. O delta de preço-para-desempenho importa para cargas de trabalho agentic sensíveis a custos, especialmente se a configuração Finance Agent v2 (2x velocidade com 1/7 do custo) se mantiver em produção.

Fontes

Tudo que sustenta esta nota
  1. 01 Primary source news.smol.ai
  2. 02 artificialanalysis.ai artificialanalysis.ai “Meta's Muse Spark 1.2 scores 54 on the Artificial Analysis Intelligence Index”
  3. 03 x.com x.com “Meta's internal Muse Spark models achieved gold-medal results across the International Physics Olympiad, Asian Physics Olympiad, International Mathematical Olympiad, International Chemistry Olympiad, and Romanian Masters of Mathematics”
  4. 04 orcarouter.ai orcarouter.ai “Muse Spark 1.2 costs $0.40 per Intelligence Index task at Meta's unchanged $1.25/$4.25 per 1M token pricing, with only Grok 4.5 (high, $0.37) and GPT-5.6 Sol (medium, $0.39) cheaper in its intelligence cluster”