Investigadores de la Universidad de Aalborg y Seafill extrajeron razonamiento intermedio de modelos fronterizos incluyendo GPT-6 Astra registrando una herramienta personalizada a través de una API estándar, luego compararon los rastros contra chain-of-thought nativo en baselines de código abierto. El artículo, escrito por Xiaoyu Luo, Tao Ren, Wenrui Yu, Xiao Li, Qiongxiu Li y Johannes Bjerva, encuentra que Astra exhibe razonamiento dirigido eficiente en tokens, seleccionando una trayectoria correcta más temprano, mientras resuelve pasos elementales internamente y externaliza solo razonamiento crucial.
El método de extracción funciona forzando al modelo a llamar una herramienta de razonamiento en la primera invocación de API, registrando su salida, luego permitiendo selección automática de herramientas para llamadas posteriores. En modelos de código abierto donde chain-of-thought nativo es observable—DeepSeek-V4-Flash y GLM-5.2—el razonamiento forzado recupera rendimiento de tarea cercano al nativo. En el benchmark MATH, DeepSeek-V4-Flash logró 73.3% de precisión con razonamiento forzado versus 70.0% con razonamiento nativo; GLM-5.2 alcanzó 84.3% con razonamiento forzado contra 89.9% nativo. Los rastros extraídos muestran superposición léxica sustancial con razonamiento nativo y estructura funcional coarse similar, validando su uso como proxy conductual para modelos de código cerrado donde rastros nativos no están disponibles.
A través de tres benchmarks—MATH (80 problemas de competencia), Humanity's Last Exam (100 problemas) y LiveCodeBench (100 problemas)—el artículo caracteriza cómo los modelos fronterizos estructuran su razonamiento. Astra produce los rastros más cortos y menos comprimibles entre los modelos probados. En MATH, los árboles de razonamiento de Astra tienen un ancho mediano de 5.0 nodos comparado a 12.0 para GPT-5.6 Sol, 22.0 para Claude Opus 4.8 y 28.5 para Claude Sonnet 5, mientras mantiene profundidad comparable. El artículo atribuye esta compresión a dos mecanismos: localmente, Astra omite expansiones elementales y usa hechos recuperados sin reiterarlos; globalmente, sigue caminos de solución más directos con menos ramificación y ensayo-error que pares.
La eficiencia viene con un costo en reutilización. Cuando el artículo trasplantó rastros de razonamiento entre modelos, los rastros comprimidos de Astra se transfirieron menos efectivamente a modelos receptores más débiles. Receptores fuertes reprodujeron casi toda la precisión de Astra cuando se les dio su razonamiento como contexto, pero modelos más débiles como Claude Haiku 4.5 y GPT-5.4 Nano recuperaron sustancialmente menos, a veces fallando en producir respuestas correctas que ya estaban presentes en el rastro. Los rastros de Sol y Opus se transfirieron con poca pérdida a través de todos los receptores. El artículo nota que este patrón aparece solo para los rastros más comprimidos y sugiere que "el valor de un rastro de razonamiento como supervisión puede no ser intrínseco sino relativo al modelo que aprenderá de él."
La limitación es estructural: la brevedad de Astra deja implícitos los pasos rutinarios que modelos más débiles no pueden reconstruir. Para equipos construyendo stacks de inferencia, esto crea una tensión entre eficiencia de modelo fronterizo y usabilidad de rastros de razonamiento para destilación o aprendizaje en contexto. Un rastro comprimido optimiza para costo de token en el maestro pero puede requerir un estudiante más fuerte para extraer valor de él, estrechando el conjunto de modelos que pueden aprender efectivamente de razonamiento fronterizo.