aiexpert
Inicio / Noticias / Nota
Research · 21 ago 2026, 14:03 · 4 fuentes

Claude Opus 5 obtiene 30.2% en ARC-AGI-3, casi 4x anterior; formula independentemente ecuaciones algebraicas

Claude Opus 5 de Anthropic logró 30.2% en ARC-AGI-3, el benchmark de razonamiento diseñado para medir inteligencia fluida en tareas novedosas, casi cuadruplicando el récord anterior de GPT-5.6 Sol de 7.8%. La puntuación fue verificada independientemente por la Fundación ARC Prize. ARC-AGI-3 presenta tareas que los modelos nunca han encontrado en el entrenamiento—cada entorno está garantizado que es novedoso, haciendo que la memorización sea irrelevante y forzando la verdadera inferencia de reglas desde primeros principios.

Durante las pruebas, Opus 5 mostró un comportamiento de razonamiento no documentado previamente en modelos frontera: formuló independientemente ecuaciones algebraicas de reflexión, incluida la ecuación 4_center = 2×axis − 5_center sin solicitud externa. El modelo resolvió cinco entornos previamente sin resolver, cuatro de ellos con eficiencia igual o superior a la humana, llevando el número total de entornos de demostración pública resueltos de uno a seis. En benchmarks más antiguos, Opus 5 obtiene 97.5% en ARC-AGI-1 y 90.4% en ARC-AGI-2.

Para arquitectos de IA en producción, el avance de Opus 5 en razonamiento abstracto y resolución de problemas novedosos señala un progreso mensurable en un benchmark específicamente diseñado para resistir técnicas de juego de benchmarks. El conjunto ARC-AGI filtra la memorización y el emparejamiento de patrones por construcción; un salto del 30% sobre la frontera anterior representa ganancias en capacidad de razonamiento arquitectónico y estrategia de búsqueda en tiempo de inferencia, no solo volumen de datos de entrenamiento.

Fuentes

Todo lo que sostiene esta nota
  1. 01 Primary source arcprize.org
  2. 02 arcprize.org arcprize.org “Claude Opus 5 30.2% on ARC-AGI-3; previously 7.8% (GPT-5.6 Sol); solved five new environments”
  3. 03 officechai.com officechai.com “Claude Opus 5 triples previous best score on ARC-AGI-3; independently formulated reflection equations no model had produced”
  4. 04 arcprize.org arcprize.org “97.5% on ARC-AGI-1 at Max reasoning; 90.4% on ARC-AGI-2”