LangChain libera ReviewBench: benchmark para avaliar agentes de revisão de código de feedback real de PR
LangChain lançou ReviewBench, um novo benchmark para avaliar agentes de revisão de código construido a partir de revisões reais de PR em sua própria base de código LangSmith. O benchmark contém 59 tarefas reproduzíveis derivadas de comentários curados por revisores confiáveis, medindo se os agentes podem identificar problemas de código substantivos—como restrições de inquilino perdidas em consultas de banco de dados ou regressões de paridade de API—em vez de apenas erros de sintaxe ou bugs óbvios. Cada tarefa inclui o contexto de PR congelado, um stub local do GitHub, o repositório semeado completo e um verificador que marca cobertura (se o agente encontrou o problema de base) e precisão (se as descobertas enviadas são corretas).
Os resultados mostram que os modelos atuais com um harness de agente básico recuperam apenas cerca de 30% dos problemas de base que revisores confiáveis encontraram. Luna e Terra tiveram desempenho mais baixo do que o esperado, mostrando estratégias de revisão mais estreitas que se concentraram em descobertas óbvias e pararam cedo, mantendo o custo de token baixo, mas prejudicando a cobertura. Uma configuração sintonizada com maior esforço de raciocínio e um prompt de revisão estruturado melhorou o desempenho de Luna, sugerindo que engenharia de prompt e design de harness importam significativamente para agentes de revisão de código.
Para arquitetos construindo fluxos de trabalho de agentes de revisão de código, ReviewBench fornece uma maneira agnóstica de modelo para medir se um LLM pode capturar problemas específicos de domínio que exigem entendimento de contratos de sistema implícitos—não apenas escanear por defeitos óbvios. O fato de que mesmo os melhores modelos estão perdendo 70% das edições de revisões reais sugere que agentes de revisão de código precisam de sintonia cuidadosa e sintonia específicas do domínio ou recuperação para serem prôntos para produção.
Fontes
- Primary source
- langchain.com
“ReviewBench currently has 59 tasks covering 64 baseline issues. The main result is that current models with a basic harness still miss most curated reviewer findings. The strongest runs recover about 30% of the baseline issues.”