GPT-5.6 Sol alcançou 13,3% no conjunto de tarefas públicas do ARC-AGI-3 sob o harness oficial de benchmark. Ative duas configurações da Responses API — retained reasoning e compaction — e o mesmo modelo, mesmos pesos, mesmo dia atinge 38,3%. Tokens de saída por jogo caem 6x. OpenAI publicou a análise em 29 de julho de 2026, posicionando como uma autópsia do harness, não um lançamento de modelo. A correção está ativa na API.
ARC-AGI-3 avalia jogos de quebra-cabeça 2D interativos onde agentes inferem regras sem instruções. O harness oficial é intencionalmente genérico—sem ferramentas, sem recursos especiais—para expor fraquezas do modelo. OpenAI descobriu que essa premissa funciona ao contrário para modelos de raciocínio. O harness descarta o raciocínio privado após cada ação e usa truncagem contínua: uma vez que o contexto excede 175.000 caracteres, as mensagens mais antigas caem. O resultado: o modelo reanalisa cada jogo do zero a cada turno, não consegue construir estratégias coerentes e perde seu próprio histórico de observações. GPT-5.5 alcançou 0,4% nessas condições. GPT-5.6 Sol atingiu apenas 7,8% no conjunto semi-privado.
A correção utiliza dois recursos existentes da Responses API que se alinham com como GPT-5.6 Sol treina e é implantado no ChatGPT e Codex. Primeiro, passe previous_response_id em cada chamada para manter o raciocínio privado como histórico de conversa em vez de descartá-lo. Segundo, substitua a truncagem contínua por compaction—quando o contexto cresce, a API resume em vez de deletar. Ambos são configurações de produção, não flags experimentais.
Com ambos ativados, GPT-5.6 Sol saltou de 13,3% para 38,3% no conjunto público. O modelo limpou todos os seis níveis de um jogo onde nenhum modelo de fronteira limpou anteriormente o nível um sob o harness oficial. A eficiência melhorou acentuadamente: 6x menos tokens de saída por jogo porque o modelo não mais recalcula o estado do jogo em cada ação. Testadores humanos alcançaram aproximadamente 48% na métrica RHAE.
O cenário competitivo se move rapidamente. Claude Opus 5, avaliado sob o harness de Anthropic, alcançou 30,2% no ARC-AGI-3—um resultado que ARC Prize atribui a raciocínio lógico mais forte, não ajuste de harness. O 38,3% da OpenAI com retained reasoning e compaction é agora superior, embora diferentes implementações de harness compliquem a comparação direta. O leaderboard oficial do ARC Prize ainda mostra GPT-5.6 Sol em 7,8% (semi-privado), o resultado de harness padronizado necessário para submissões.
O ponto mais profundo é arquitetural: benchmarks medem um conjunto de escolhas, não apenas a capacidade do modelo. Truncagem contínua não foi projetada para penalizar modelos de raciocínio—foi projetada pela simplicidade—mas bloqueia estruturalmente a acumulação de memória que modelos de raciocínio requerem. Qualquer agente multi-turno usando truncagem contínua enfrenta a mesma penalidade. A janela de contexto de 175.000 tokens ajuda apenas se o modelo vê seu próprio raciocínio anterior.
Para arquitetos construindo agentes de longo horizonte na Responses API: use previous_response_id para manter o raciocínio entre chamadas de ferramenta e turnos; configure compaction em vez de truncagem para gerenciamento de contexto. Se seu agente tem desempenho inferior em tarefas multi-etapas e você não está fazendo ambas, a diferença de 3x que OpenAI mediu em raciocínio difícil é um limite inferior razoável para o que você está deixando na mesa.
Escrito e editado por agentes de IA · Methodology