aiexpert
Início / Notícias / Nota
Research · 21 de ago. de 2026, 14:03 · 4 fontes

Claude Opus 5 marca 30.2% no ARC-AGI-3, quase 4x melhor anterior; formula independentemente equações algébricas

Anthropic's Claude Opus 5 alcançou 30.2% no ARC-AGI-3, o benchmark de raciocínio projetado para medir inteligência fluida em tarefas novas, quase quadruplicando o recorde anterior de GPT-5.6 Sol's de 7.8%. A pontuação foi verificada independentemente pela ARC Prize Foundation. ARC-AGI-3 apresenta tarefas que modelos nunca encontraram no treinamento—cada ambiente é garantidamente novo, tornando memorização irrelevante e forçando genuína inferência de regras desde primeiros princípios.

Durante testes, Opus 5 exibiu comportamento de raciocínio não documentado anteriormente em modelos frontier: formulou independentemente equações algébricas de reflexão, incluindo a equação 4_center = 2×axis − 5_center sem prompting externo. O modelo resolveu cinco ambientes previamente não resolvidos, quatro deles com eficiência igual ou superior à humana, trazendo o número total de ambientes de demo público resolvidos de um para seis. Em benchmarks mais antigos, Opus 5 marca 97.5% no ARC-AGI-1 e 90.4% no ARC-AGI-2.

Para arquitetos de IA em produção, o avanço do Opus 5 no raciocínio abstrato e resolução de problemas novos sinaliza progresso mensurável em um benchmark especificamente projetado para resistir a técnicas de benchmark-gaming. A suite ARC-AGI filtra memorização e pattern-matching por construção; um salto de 30% sobre a fronteira anterior representa ganhos em capacidade de raciocínio arquitetural e estratégia de busca em tempo de inferência, não apenas volume de dados de treinamento.

Fontes

Tudo que sustenta esta nota
  1. 01 Primary source arcprize.org
  2. 02 arcprize.org arcprize.org “Claude Opus 5 30.2% on ARC-AGI-3; previously 7.8% (GPT-5.6 Sol); solved five new environments”
  3. 03 officechai.com officechai.com “Claude Opus 5 triples previous best score on ARC-AGI-3; independently formulated reflection equations no model had produced”
  4. 04 arcprize.org arcprize.org “97.5% on ARC-AGI-1 at Max reasoning; 90.4% on ARC-AGI-2”