Pesquisadores da Salesforce AI Research e da Universidade de Illinois Urbana-Champaign publicaram um artigo demonstrando que um modelo "builder" mais forte pode construir harnesses no tempo de inferência elevando a acurácia de um modelo "target" mais fraco de 0.49 para 0.91 em benchmarks de Theory-of-Mind sem modificar os pesos do modelo target. O artigo, "AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses," formaliza o andaime forte-para-fraco: transferência de capacidade através do design de ambiente no tempo de inferência apenas.
O modelo builder recebe 5% dos dados de benchmark e refina iterativamente um harness—lógica de roteamento de tarefas, templates de prompt, solvers determinísticos, exemplares few-shot, passes de verificação e execução de formato. O modelo target (GPT-5.4-mini) permanece congelado durante todo o processo. A melhor configuração atingiu 0.91 de acurácia macro-average em quatro benchmarks ToM, acima da linha de base de 0.49.
Três mecanismos impulsionam os ganhos: descarregar raciocínio instável do modelo em código determinístico, roteamento de subtipo específico de benchmark e execução de formato de resposta rigorosa. Prompting chain-of-thought mais longo e amostragem mais ampla—as alavancas típicas—não explicam o salto. A externalização de estrutura faz.
No BigToM, os melhores harnesses compilaram estrutura de tarefa em regras executáveis inteiramente, reduzindo o benchmark a um procedimento determinístico. Os autores sinalizam isso como um atalho. Em outros benchmarks ToM, os ganhos refletem redução genuína de carga cognitiva—o harness pré-decompôs problemas e restringiu o formato de saída. Os erros residuais se concentram nos casos mais difíceis: profundidade de recursão de crença de pelo menos dois e subtarefas de inferência de objetivo bayesiano.
O esforço de raciocínio builder melhora a qualidade do harness monotonicamente. Mais computação de inferência no builder compensa no design do harness, amortizando através de cada chamada subsequente para o modelo target mais barato. Os efeitos de plataforma são modestos relativos à capacidade do modelo builder; o padrão é agnóstico de framework. Modelos target mais fracos recebem os maiores ganhos absolutos—invertendo intuição típica. Modelos onde fine-tuning é mais caro são precisamente onde engenharia de harness entrega mais.
O caso de implantação é direto: um custo de engenharia único que compensa no tempo de inferência. Equipes executando arquiteturas em camadas—modelos de classe frontier para planejamento, modelos em escala mini para execução—agora têm princípios de design de harness formalizados e limites de desempenho medidos. O salto de 0.49 para 0.91 torna a economia clara. O código é publicamente disponível.
Antes de atualizar o modelo target, construa o harness: roteia por subtipo, execute formato de resposta deterministicamente, e descarregue qualquer sub-problema solucionável por código ao invés de raciocínio de modelo.