Anthropic's Claude Opus 5 alcançou 30.2% no ARC-AGI-3, o benchmark de raciocínio projetado para medir inteligência fluida em tarefas novas, quase quadruplicando o recorde anterior de GPT-5.6 Sol's de 7.8%. A pontuação foi verificada independentemente pela ARC Prize Foundation. ARC-AGI-3 apresenta tarefas que modelos nunca encontraram no treinamento—cada ambiente é garantidamente novo, tornando memorização irrelevante e forçando genuína inferência de regras desde primeiros princípios.
Durante testes, Opus 5 exibiu comportamento de raciocínio não documentado anteriormente em modelos frontier: formulou independentemente equações algébricas de reflexão, incluindo a equação 4_center = 2×axis − 5_center sem prompting externo. O modelo resolveu cinco ambientes previamente não resolvidos, quatro deles com eficiência igual ou superior à humana, trazendo o número total de ambientes de demo público resolvidos de um para seis. Em benchmarks mais antigos, Opus 5 marca 97.5% no ARC-AGI-1 e 90.4% no ARC-AGI-2.
Para arquitetos de IA em produção, o avanço do Opus 5 no raciocínio abstrato e resolução de problemas novos sinaliza progresso mensurável em um benchmark especificamente projetado para resistir a técnicas de benchmark-gaming. A suite ARC-AGI filtra memorização e pattern-matching por construção; um salto de 30% sobre a fronteira anterior representa ganhos em capacidade de raciocínio arquitetural e estratégia de busca em tempo de inferência, não apenas volume de dados de treinamento.