Pesquisadores da Universidade Renmin da China publicaram CalibForge, um pipeline autônomo que sintetiza tarefas de treinamento de agentes terminais em escala. O sistema usa comportamento de solver para identificar tarefas aprendíveis, depois as revisa. Resultado: 5.431 tarefas calibradas que melhoram modelos em 24,71 pontos percentuais no Terminal-Bench 2.0, 27,68 no SWE-bench Pro e 30,04 no Doc2Repo.

A ideia central: executabilidade não é aprendibilidade. Uma tarefa que todo solver passa ou falha não treina nada. Pipelines existentes validam apenas que as tarefas rodem. CalibForge adiciona uma camada de calibração para medir se as tarefas discriminam entre capacidades de solver.

Dois modos de calibração impulsionam isso. Calibração multi-solver roteia candidatos através de um pool heterogêneo. Se solvers discordam—alguns passam, alguns falham—a tarefa é aprendível. Calibração contrastiva de solver é cirúrgica: designe um solver forte que deve passar e um fraco que deve falhar. Tarefas faltando esse intervalo são revisadas e reavaliadas. Ambos os métodos ancoram dificuldade ao comportamento de solver demonstrado, não estimativas humanas, que historicamente correlacionam mal com o que modelos em um nível dado podem aprender.

Terminal-Bench 2.0 fornece contexto: 89 tarefas Docker abrangendo engenharia de software, computação científica, cibersegurança e ML. Modelos de fronteira chegam a menos de 65%. Modelos menores se agrupam em torno de 15%. Modelos treinados com CalibForge atingem 32,58% e 47,57% dependendo do modelo base—ganhos sólidos dado o teto, embora ainda abaixo da fronteira.

O sinal mais forte é transferência fora da distribuição. SWE-bench Pro e Doc2Repo não fizeram parte do treinamento, mas os modelos melhoraram 27,68 e 30,04 pontos percentuais. O processo de calibração seleciona para capacidade geral de agente terminal em vez de correspondência de padrão do Terminal-Bench. Aprendibilidade relativa a solver transfere entre domínios.

O artigo omite custo de computação para calibração completa e detalhes de composição de pool heterogêneo. Equipes replicando isso devem construir seu próprio pool de solver, tornando a qualidade parcialmente dependente da escolha de solver—uma dependência circular se esses solvers também estão sendo treinados.

Para equipes de ML que escrevem manualmente suites de avaliação ou usam filtragem de solver único, CalibForge oferece uma alternativa concreta: substituir estimativa de dificuldade humana por desacordo de solver. O corpus de 5.431 tarefas é público. Geração de currículo calibrada por solver transfere, e os números sugerem que o método está pronto para testar em sua stack.