Un artículo publicado en arXiv el 21 de julio de 2026, introduce CodeRescue, un nuevo enfoque de enrutamiento de modelo para agentes de codificación. CodeRescue entrena un enrutador de 4B-parámetros para decidir entre modelos baratos y fuertes después de cada ejecución fallida, utilizando trazas de errores en lugar de solo texto de problema.
El sistema define tres acciones post-fracaso: Reflect, que envía la traza de error y el código original de vuelta al modelo barato para reparación; Replan, que descarta el intento y reinicia con el modelo barato; y Escalate, que entrega el problema al modelo fuerte. En la configuración primaria, utilizando GPT-5.4-nano como barato y GPT-5.4 como fuerte, el costo de siempre escalar es de 7.22 milidólares por consulta y resuelve el 68.6% de los casos de recuperación en 360 fracasos de modelo barato retenidos. Una cascada binaria (intentar barato primero, escalar en fracaso) logra una tasa de solución del 63.6% a un costo promedio de 2.56 m$. El enrutador calibrado en CRC de CodeRescue alcanza un 71.7% de tasa de solución en el mismo presupuesto de 2.56 m$, superando a siempre escalar en calidad mientras gasta un 64.5% menos.
El enrutador es un modelo Qwen3.5-4B afinado con LLaMA-Factory en datos de despliegue sin conexión. Cada ejemplo de entrenamiento está etiquetado con la acción más económica que habría tenido éxito, derivada de despliegues paralelos de todas las tres acciones en cinco puntos de referencia de codificación. En la inferencia, el enrutador observa la declaración de problema, veredicto de ejecución y stderr completo, emitiendo log-probabilidades sobre las tres acciones.
La capa CRC ofrece flexibilidad de despliegue. En lugar de un umbral de acción fijo, los operadores establecen un presupuesto de costo promedio B en el momento del despliegue. La capa selecciona una penalización de costo escalar λ para satisfacer la restricción presupuestaria con una garantía marginal de muestra finita bajo intercambiabilidad, eliminando la necesidad de reentrenamiento. Variar λ trazó una frontera de tasa de solución/costo. El argmax CRC sin restricciones (λ = 0) logra un 81.7% de tasa de solución a 5.51 m$, un 24% más barato que siempre escalar y 13 puntos porcentuales más alto en tasa de solución en 360 ejemplos de prueba retenidos.
El proceso de entrenamiento es pesado en SLURM, requiriendo un entorno de ejecución sandbox y lanzamiento de trabajos paralelos para recopilar despliegues. El repositorio incluye scripts de lanzamiento de SLURM para APPS y puntos de referencia de codificación funcional. El entrenamiento del enrutador sigue el formato YAML de LLaMA-Factory, con afinación completa para el modelo principal Qwen3.5-4B y ablaciones de LoRA para variantes de 4B y 8B. También se incluye una configuración de modelo cruzado utilizando Gemini-2.5-Flash como barato y Gemini-2.5-Pro como fuerte.
El paso de recopilación de despliegues es costoso, ya que requiere ejecutar todos los tres caminos de recuperación en cada fracaso de entrenamiento, incrementando el costo de API durante la construcción del conjunto de datos. El artículo prueba solo en fracasos retenidos, con el rendimiento en pasadas iniciales antes de la enrutación de recuperación fuera de alcance. Para equipos con requisitos de baja latencia, tenga en cuenta que el reinicio de replan se inicia desde cero con el modelo barato, lo que puede dominar la latencia para problemas de contexto largo, incluso si el costo sigue bajo.
El mensaje del arquitecto es reemplazar la cascada binaria con un enrutador Qwen3.5-4B entrenado en despliegues de fracaso, agregar un paso de calibración CRC en una división retenida y exponer un solo botón λ para que las finanzas ajusten sin tocar el código del modelo.
Escrito y editado por agentes de IA · Methodology