Investigadores de Salesforce AI Research y la Universidad de Illinois Urbana-Champaign publicaron un artículo demostrando que un modelo "builder" más fuerte puede construir harnesses en tiempo de inferencia elevando la precisión de un modelo "target" más débil de 0.49 a 0.91 en benchmarks de Theory-of-Mind sin modificar los pesos del modelo target. El artículo, "AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses," formaliza el andamio fuerte-a-débil: transferencia de capacidad a través del diseño de entorno únicamente en tiempo de inferencia.
El modelo builder recibe el 5% de los datos de benchmark e itera refinando un harness—lógica de enrutamiento de tareas, plantillas de prompt, solucionadores determinísticos, ejemplares few-shot, pasos de verificación y aplicación de formato. El modelo target (GPT-5.4-mini) permanece congelado en todo momento. La mejor configuración logró 0.91 de precisión macro-average en cuatro benchmarks ToM, por encima de la línea base de 0.49.
Tres mecanismos impulsan las ganancias: descargar el razonamiento inestable del modelo en código determinístico, enrutamiento de subtipo específico del benchmark y aplicación estricta de formato de respuesta. Prompting chain-of-thought más largo y muestreo más amplio—las palancas típicas—no explican el salto. La externalización de estructura sí.
En BigToM, los mejores harnesses compilaron la estructura de tareas en reglas ejecutables completamente, reduciendo el benchmark a un procedimiento determinístico. Los autores lo señalan como un atajo. En otros benchmarks ToM, las ganancias reflejan una reducción genuina de carga cognitiva—el harness pre-descompone problemas y restringe el formato de salida. Los errores residuales se concentran en los casos más difíciles: profundidad de recursión de creencia de al menos dos e inferencia bayesiana de objetivos subtareas.
El esfuerzo de razonamiento del builder mejora la calidad del harness monotónicamente. Más computación de inferencia en el builder se amortiza en el diseño del harness, distribuyéndose en cada llamada posterior al modelo target más económico. Los efectos de plataforma son modestos relativos a la capacidad del modelo builder; el patrón es agnóstico del framework. Los modelos target más débiles reciben las mayores ganancias absolutas—invirtiendo la intuición típica. Los modelos donde el fine-tuning es más costoso son precisamente donde la ingeniería de harness aporta más.
El caso de implementación es directo: un costo de ingeniería único que se amortiza en tiempo de inferencia. Los equipos que ejecutan arquitecturas escalonadas—modelos de clase frontier para planificación, modelos a escala mini para ejecución—ahora tienen principios formalizados de diseño de harness y límites de desempeño medidos. El salto de 0.49 a 0.91 deja clara la economía. El código está disponible públicamente.
Antes de actualizar el modelo target, construya el harness: enrute por subtipo, aplique formato de respuesta determinísticamente, y descargue cualquier sub-problema solucionable por código en lugar de razonamiento de modelo.