Pesquisadores da Aalborg University e Seafill extraíram raciocínio intermediário de modelos de fronteira incluindo GPT-6 Astra registrando uma ferramenta customizada através de uma API padrão, depois compararam os traces contra chain-of-thought nativo em baselines de código aberto. O paper, de autoria de Xiaoyu Luo, Tao Ren, Wenrui Yu, Xiao Li, Qiongxiu Li e Johannes Bjerva, constata que Astra exibe raciocínio direcionado eficiente em tokens, selecionando uma trajetória correta mais cedo, enquanto resolve passos elementares internamente e externaliza apenas raciocínio crucial.

O método de extração funciona forçando o modelo a chamar uma ferramenta de raciocínio na primeira invocação de API, registrando sua saída, depois permitindo seleção automática de ferramenta para chamadas subsequentes. Em modelos de código aberto onde chain-of-thought nativo é observável—DeepSeek-V4-Flash e GLM-5.2—o raciocínio forçado recupera desempenho de tarefa próximo ao nativo. No benchmark MATH, DeepSeek-V4-Flash alcançou 73.3% de acurácia com raciocínio forçado versus 70.0% com raciocínio nativo; GLM-5.2 atingiu 84.3% com raciocínio forçado contra 89.9% nativo. Os traces extraídos mostram sobreposição lexical substancial com raciocínio nativo e estrutura funcional coarse similar, validando seu uso como proxy comportamental para modelos de código fechado onde traces nativos não estão disponíveis.

Em três benchmarks—MATH (80 problemas de competição), Humanity's Last Exam (100 problemas) e LiveCodeBench (100 problemas)—o paper caracteriza como modelos de fronteira estruturam seu raciocínio. Astra produz os traces mais curtos e menos compressíveis entre os modelos testados. No MATH, as árvores de raciocínio de Astra têm largura mediana de 5.0 nós comparado a 12.0 para GPT-5.6 Sol, 22.0 para Claude Opus 4.8 e 28.5 para Claude Sonnet 5, mantendo profundidade comparável. O paper atribui essa compressão a dois mecanismos: localmente, Astra omite expansões elementares e usa fatos recuperados sem reafirmá-los; globalmente, segue caminhos de solução mais diretos com menos ramificação e trial-and-error que pares.

A eficiência vem com um custo em reusabilidade. Quando o paper transplantou traces de raciocínio entre modelos, os traces comprimidos de Astra se transferiram menos efetivamente para modelos receptores mais fracos. Receptores fortes reproduziram quase toda a acurácia de Astra quando dado seu raciocínio como contexto, mas modelos mais fracos como Claude Haiku 4.5 e GPT-5.4 Nano recuperaram substancialmente menos, às vezes falhando em produzir respostas corretas que já estavam presentes no trace. Traces de Sol e Opus se transferiram com pouca perda em todos os receptores. O paper nota que esse padrão aparece apenas para os traces mais comprimidos e sugere que "o valor de um trace de raciocínio como supervisão pode não ser intrínseco mas relativo ao modelo que aprenderá com ele."

A limitação é estrutural: a brevidade de Astra deixa implícitos os passos rotineiros que modelos mais fracos não conseguem reconstruir. Para times construindo stacks de inferência, isso cria uma tensão entre eficiência de modelo de fronteira e usabilidade de traces de raciocínio para destilação ou aprendizado em contexto. Um trace comprimido otimiza para custo de token no professor mas pode requerer um aluno mais forte para extrair valor dele, estreitando o pool de modelos que podem aprender efetivamente de raciocínio de fronteira.