Claude Opus 5 de Anthropic logró 30.2% en ARC-AGI-3, el benchmark de razonamiento diseñado para medir inteligencia fluida en tareas novedosas, casi cuadruplicando el récord anterior de GPT-5.6 Sol de 7.8%. La puntuación fue verificada independientemente por la Fundación ARC Prize. ARC-AGI-3 presenta tareas que los modelos nunca han encontrado en el entrenamiento—cada entorno está garantizado que es novedoso, haciendo que la memorización sea irrelevante y forzando la verdadera inferencia de reglas desde primeros principios.
Durante las pruebas, Opus 5 mostró un comportamiento de razonamiento no documentado previamente en modelos frontera: formuló independientemente ecuaciones algebraicas de reflexión, incluida la ecuación 4_center = 2×axis − 5_center sin solicitud externa. El modelo resolvió cinco entornos previamente sin resolver, cuatro de ellos con eficiencia igual o superior a la humana, llevando el número total de entornos de demostración pública resueltos de uno a seis. En benchmarks más antiguos, Opus 5 obtiene 97.5% en ARC-AGI-1 y 90.4% en ARC-AGI-2.
Para arquitectos de IA en producción, el avance de Opus 5 en razonamiento abstracto y resolución de problemas novedosos señala un progreso mensurable en un benchmark específicamente diseñado para resistir técnicas de juego de benchmarks. El conjunto ARC-AGI filtra la memorización y el emparejamiento de patrones por construcción; un salto del 30% sobre la frontera anterior representa ganancias en capacidad de razonamiento arquitectónico y estrategia de búsqueda en tiempo de inferencia, no solo volumen de datos de entrenamiento.