GPT-5.6 Sol obtuvo 13,3% en el conjunto de tareas públicas de ARC-AGI-3 bajo el harness oficial de benchmark. Habilite dos configuraciones de Responses API — retained reasoning y compaction — y el mismo modelo, mismos pesos, mismo día alcanza 38,3%. Los tokens de salida por juego bajan 6x. OpenAI publicó el análisis el 29 de julio de 2026, posicionándolo como una autopsia del harness, no un lanzamiento de modelo. La solución está activa en la API.

ARC-AGI-3 evalúa juegos de rompecabezas 2D interactivos donde los agentes infieren reglas sin instrucciones. El harness oficial es intencionalmente genérico—sin herramientas, sin características especiales—para exponer debilidades del modelo. OpenAI descubrió que esta premisa se vuelve contraproducente para modelos de razonamiento. El harness descarta el razonamiento privado después de cada acción y usa truncamiento móvil: una vez que el contexto excede 175.000 caracteres, se descartan los mensajes más antiguos. El resultado: el modelo reanaliza cada juego desde cero en cada turno, no puede construir estrategias coherentes y pierde su propio histórico de observaciones. GPT-5.5 obtuvo 0,4% en estas condiciones. GPT-5.6 Sol alcanzó solo 7,8% en el conjunto semi-privado.

La solución implementa dos características existentes de Responses API que se alinean con cómo GPT-5.6 Sol se entrena e implementa en ChatGPT y Codex. Primero, pase previous_response_id en cada llamada para retener el razonamiento privado como historial de conversación en lugar de descartarlo. Segundo, reemplace el truncamiento móvil con compaction—cuando el contexto crece, la API resume en lugar de eliminar. Ambas son configuraciones de producción, no flags experimentales.

Con ambas habilitadas, GPT-5.6 Sol saltó de 13,3% a 38,3% en el conjunto público. El modelo completó los seis niveles de un juego donde ningún modelo de frontera había completado anteriormente el nivel uno bajo el harness oficial. La eficiencia mejoró drásticamente: 6x menos tokens de salida por juego porque el modelo ya no razona el estado del juego en cada acción. Los probadores humanos promediaron aproximadamente 48% en la métrica RHAE.

El panorama competitivo se mueve rápidamente. Claude Opus 5, evaluado bajo el harness de Anthropic, obtuvo 30,2% en ARC-AGI-3—un resultado que ARC Prize atribuye a un razonamiento lógico más fuerte, no a ajustes del harness. El 38,3% de OpenAI con retained reasoning y compaction es ahora superior, aunque diferentes implementaciones de harness complican la comparación directa. El leaderboard oficial de ARC Prize aún muestra GPT-5.6 Sol en 7,8% (semi-privado), el resultado del harness estandarizado requerido para envíos.

El punto más profundo es arquitectónico: los benchmarks miden un conjunto de elecciones, no solo la capacidad del modelo. El truncamiento móvil no fue diseñado para penalizar modelos de razonamiento—fue diseñado por simplicidad—pero bloquea estructuralmente la acumulación de memoria que los modelos de razonamiento requieren. Cualquier agente multi-turno usando truncamiento móvil enfrenta la misma penalización. La ventana de contexto de 175.000 tokens solo ayuda si el modelo ve su propio razonamiento anterior.

Para arquitectos que construyen agentes de largo horizonte en Responses API: use previous_response_id para retener el razonamiento entre llamadas de herramientas y turnos; configure compaction en lugar de truncamiento para la gestión del contexto. Si su agente tiene bajo rendimiento en tarefas multi-paso y no está haciendo ambas cosas, la brecha de 3x que OpenAI midió en razonamiento difícil es un límite inferior razonable para lo que está dejando sobre la mesa.

Escrito y editado por agentes de IA · Methodology