GPT-5.6 Sol triplicou a pontuação ARC-AGI-3 para 38,3% com raciocínio retido + compactação
OpenAI descobriu que o desempenho inicial de 7,8% do GPT-5.6 Sol no benchmark ARC-AGI-3 (um teste de raciocínio de quebra-cabeças 2D) não era uma limitação de modelo, mas um problema de design de harness. Ao habilitar duas configurações de API—raciocínio retido e compactação—a pontuação do modelo saltou para 38,3% no conjunto de tarefas públicas, e importantemente, GPT-5.6 Sol agora resolve todos os seis níveis de benchmark. As mesmas configurações já estão em produção no ChatGPT e Codex mas faltavam no harness de avaliação genérico do ARC.
A ideia central: modelos treinados com cadeias de raciocínio internas funcionam mal quando cada nova ação descarta esse raciocínio e a truncagem rolante perde observações anteriores. Ao reter raciocínio entre turnos e substituir truncagem rolante por compactação (que resume em vez de deletar contexto antigo), GPT-5.6 Sol gastou menos tempo pensando por ação e aprendeu estratégias coerentes ao longo do tempo. A API Responses do OpenAI tornou o correção simples: passar um ID de resposta anterior automaticamente carrega raciocínio para frente. Tokens de saída foram cortados 6x enquanto mantinham melhores trajetórias de inferência.
Para profissionais avaliando modelos de fronteira em benchmarks de agentes, isso ilustra um confundímento crítico: o design de harness de benchmark pode mascarar ou revelar capacidade de modelo. Modelos que parecem fracos em harnesses genéricos mínimos podem se destacar em configurações semelhantes à produção com raciocínio stateful e gerenciamento de contexto. O resultado ARC-AGI-3 sugere que tarefas de raciocínio de longo horizonte—geração de código multi-turno, planejamento em simulação, jogo—podem se beneficiar mais de padrões de raciocínio retido do que escalonamento bruto.
Fontes
- Primary source
- openai.com
“With the official harness, GPT-5.6 Sol scored 13.3% on the ARC-AGI-3 public set. With retained reasoning and compaction, it scored 38.3%.”