Investigadores de la Universidad Renmin de China publicaron CalibForge, un pipeline autónomo que sintetiza tareas de entrenamiento de agentes terminales a escala. El sistema usa comportamiento de solver para identificar tareas aprendibles, luego las revisa. Resultado: 5.431 tareas calibradas que mejoran modelos en 24,71 puntos porcentuales en Terminal-Bench 2.0, 27,68 en SWE-bench Pro y 30,04 en Doc2Repo.
La insight central: ejecutabilidad no es aprendibilidad. Una tarea que todo solver aprueba o falla no entrena nada. Los pipelines existentes validan solo que las tareas se ejecuten. CalibForge añade una capa de calibración para medir si las tareas discriminan entre capacidades de solver.
Dos modos de calibración impulsan esto. La calibración multi-solver enruta candidatos a través de un pool heterogéneo. Si los solvers no están de acuerdo—algunos aprueban, otros fallan—la tarea es aprendible. La calibración contrastiva de solver es quirúrgica: designa un solver fuerte que debe aprobar y uno débil que debe fallar. Las tareas que pierden este rango se revisan y se reevalúan. Ambos métodos anclan dificultad al comportamiento de solver demostrado, no a estimaciones humanas, que históricamente correlacionan mal con lo que modelos en un nivel dado pueden aprender.
Terminal-Bench 2.0 proporciona contexto: 89 tareas Docker abarcando ingeniería de software, computación científica, ciberseguridad e IA. Los modelos de frontera no superan el 65%. Los modelos más pequeños se agrupan alrededor del 15%. Los modelos entrenados con CalibForge alcanzan 32,58% y 47,57% dependiendo del modelo base—ganancias sólidas dado el techo, aunque aún por debajo de frontera.
La señal más fuerte es transferencia fuera de distribución. SWE-bench Pro y Doc2Repo no fueron parte del entrenamiento, pero los modelos mejoraron 27,68 y 30,04 puntos porcentuales. El proceso de calibración selecciona la capacidad general del agente terminal en lugar de coincidencia de patrones Terminal-Bench. La aprendibilidad relativa a solver se transfiere entre dominios.
El artículo omite el costo de computación para calibración completa y detalles de composición del pool heterogéneo. Los equipos que replican esto deben construir su propio pool de solver, haciendo que la calidad dependa parcialmente de la elección de solver—una dependencia circular si esos solvers también se están entrenando.
Para equipos de IA que escriben suites de evaluación manualmente o usan filtrado de solver único, CalibForge ofrece una alternativa concreta: reemplazar la estimación de dificultad humana con desacuerdo de solver. El corpus de 5.431 tareas es público. La generación de currículo calibrada por solver se transfiere, y los números sugieren que el método está listo para probar en tu stack.