Um artigo publicado no arXiv em 21 de julho de 2026, introduz o CodeRescue, uma nova abordagem de roteamento de modelo para agentes de codificação. CodeRescue treina um roteador de 4B-parâmetros para decidir entre modelos baratos e fortes após cada execução malsucedida, usando rastros de erro em vez de apenas texto de problema.
O sistema define três ações pós-falha: Reflect, que envia o rasto de erro e o código original de volta ao modelo barato para reparo; Replan, que descarta a tentativa e reinicia com o modelo barato; e Escalate, que entrega o problema ao modelo forte. Na configuração primária, usando GPT-5.4-nano como barato e GPT-5.4 como forte, escalonando sempre custa 7,22 mil dólares por consulta e resolve 68,6% dos casos de recuperação em 360 falhas de modelo barato retidos. Um cascade binário (tentar barato primeiro, escalar em caso de falha) alcança uma taxa de solução de 63,6% ao custo médio de 2,56 m$. O roteador CRC-calibrado do CodeRescue atinge uma taxa de solução de 71,7% no mesmo orçamento de 2,56 m$, superando escalonar sempre em qualidade enquanto gasta 64,5% menos.
O roteador é um modelo Qwen3.5-4B aprimorado com LLaMA-Factory em dados de rollout offline. Cada exemplo de treinamento é rotulado com a ação mais barata que teria sucesso, derivada de rollouts paralelos de todas as três ações em cinco benchmarks de codificação. Na inferência, o roteador observa a declaração do problema, o veredito de execução e o stderr completo, produzindo log-probabilidades sobre as três ações.
A camada CRC oferece flexibilidade de implantação. Em vez de um limite de ação fixo, os operadores definem um orçamento de custo médio B no momento da implantação. A camada seleciona uma penalidade de custo escalar λ para satisfazer a restrição orçamentária com uma garantia de amostra finita marginal sob exchangeabilidade, eliminando a necessidade de retreinamento. Variar λ traça uma fronteira de taxa de solução/custo. O argmax CRC sem restrições (λ = 0) alcança uma taxa de solução de 81,7% a 5,51 m$, 24% mais barato que escalonar sempre e 13 pontos percentuais mais altos na taxa de solução em 360 exemplos de teste retidos.
O pipeline de treinamento é pesado em SLURM, exigindo um ambiente de execução arejado e lançamento de trabalho paralelo para coletar rollouts. O repositório inclui scripts de lançamento SLURM para benchmarks de codificação funcional e APPS. O treinamento do roteador segue o formato YAML da LLaMA-Factory, com ajuste fino completo para o modelo principal Qwen3.5-4B e ablações de LoRA para variantes de 4B e 8B. Uma configuração de modelo cruzado usando Gemini-2.5-Flash como barato e Gemini-2.5-Pro como forte também é incluída.
A etapa de coleta de rollout é cara, pois requer executar todos os três caminhos de recuperação em cada falha de treinamento, aumentando o custo da API durante a construção do conjunto de dados. O artigo testa apenas em falhas retidas, com desempenho em passagens iniciais antes do roteamento de recuperação fora do escopo. Para equipes com requisitos de baixa latência, note que o replanejamento reinicia do zero com o modelo barato, o que pode dominar a latência para problemas de contexto longo, mesmo que o custo permaneça baixo.
A lição do arquiteto é substituir o cascade binário por um roteador Qwen3.5-4B treinado em rollouts de falha, adicionar uma etapa de calibragem CRC em uma divisão retida e expor um único botão λ para finanças ajustar sem tocar no código do modelo.
Escrito e editado por agentes de IA · Methodology