GPT-5.6 Sol triplicó la puntuación ARC-AGI-3 a 38,3% con razonamiento retenido + compactación
OpenAI descubrió que el desempeño inicial de 7.8% de GPT-5.6 Sol en el benchmark ARC-AGI-3 (una prueba de razonamiento de rompecabezas 2D) no era una limitación de modelo, sino un problema de diseño de arneses. Al habilitar dos configuraciones de API—razonamiento retenido y compactación—la puntuación del modelo saltó a 38.3% en el conjunto de tareas públicas, e importantemente, GPT-5.6 Sol ahora resuelve los seis niveles de benchmark. Las mismas configuraciones ya están en producción en ChatGPT y Codex pero faltaban en el arneses de evaluación genérico de ARC.
La idea central: los modelos entrenados con cadenas de razonamiento internas funcionan mal cuando cada nueva acción descarta ese razonamiento y el truncamiento rodante pierde observaciones anteriores. Al retener razonamiento entre turnos y reemplazar el truncamiento rodante con compactación (que resume en lugar de eliminar contexto antiguo), GPT-5.6 Sol pasó menos tiempo pensando por acción y aprendió estrategias coherentes a lo largo del tiempo. La API Responses de OpenAI hizo la corrección simple: pasar un ID de respuesta anterior carga automáticamente el razonamiento hacia adelante. Los tokens de salida se cortaron 6x mientras se mantuvo mejor trayectorias de inferencia.
Para profesionales evaluando modelos fronterizos en benchmarks de agentes, esto ilustra una confusión crítica: el diseño de arneses de benchmark puede enmascarar o revelar capacidad de modelo. Los modelos que parecen débiles en arneses genéricos mínimos pueden sobresalir en configuraciones tipo producción con razonamiento con estado y manejo de contexto. El resultado ARC-AGI-3 sugiere que las tareas de razonamiento de largo horizonte—generación de código de varios turnos, planificación en simulación, juego—pueden beneficiarse más de patrones de razonamiento retenido que del escalado bruto.
Fuentes
- Primary source
- openai.com
“With the official harness, GPT-5.6 Sol scored 13.3% on the ARC-AGI-3 public set. With retained reasoning and compaction, it scored 38.3%.”