LangChain lançou sua pilha de avaliação para Deep Agents como código aberto, mudando o benchmarking de agentes de competições de comparação de texto para testes de integração em sandbox que avaliam o estado do sistema de arquivos, efeitos colaterais da API e resultados de conversas multi-turn. O framework, construído no executor Harbor que impulsiona Terminal Bench, inclui 142 tarefas em três suítes e já está em uso para controlar a liberação do Deep Agents 0.7.
A arquitetura difere das avaliações padrão de LLM em duas maneiras principais. Cada tarefa opera dentro de um sandbox Docker definido por um Dockerfile ou manifesto Compose, exigindo que o agente manipule um ambiente real em vez de apenas emitir uma conclusão. Os critérios de aprovação são determinados por um script test.sh que inspecciona artefatos e mudanças de estado, em vez de um LLM-como-juíz comparando strings de saída. Harbor orquestra o processo: ele ingere o arnês do agente, o conjunto de dados e a definição do sandbox, executa a tarefa e relata resultados binários. LangChain usa isso para pontuar seu próprio arnês de Deep Agents de código aberto em três domínios.
Harbor-Index é a suíte de integração pesada, com 82 tarefas distiladas de mais de 6.000 candidatos em 54 benchmarks existentes, abrangendo engenharia de software, busca, análise de dados e uso de ferramentas de longo horizonte. Para agentes de conversação, τ³-bench contribui com 30 tarefas multi-turn com um usuário simulado; a pontuação valida resultados reais em vez de coerência de diálogo de nível superficial. ContextBench adiciona 30 tarefas de recuperação, com o corpus completo enviado dentro do sandbox, forçando o agente a localizar e unir informações em vez de confiar em conhecimento paramétrico ou um banco de dados de vetores externo.
Devido à natureza indeterminística dos agentes, LangChain executa tarefas várias vezes para calibrar a variação; uma passagem única é considerada insuficiente. Para gerenciar os custos de iteração, eles mantêm um subconjunto "lite" congelado, ponderado em favor de tarefas de fronteira difíceis mas solucionáveis. O conjunto lite é executado aproximadamente oito vezes mais rápido e seis vezes mais barato do que o benchmark completo, que a equipe usa diariamente; o conjunto completo de 142 tarefas é reservado para decisões de lançamento. Sob ambos, há um conjunto de capacidade de testes unitários rápidos e determinísticos que visam comportamentos do arnês, como seleção de ferramentas, consistência de memória e operações de arquivo. A camada de testes unitários capturou regressões antes da suíte de integração durante o ciclo do Deep Agents 0.7, quando os engenheiros removeram o middleware de lista de afazeres embutido e reduziram significativamente o prompt do sistema. Isso resultou em menos tokens consumidos por execução e mais da cota de contexto do modelo reservada para instruções do usuário, com benchmarks fornecendo o sinal de regressão que justificou a exclusão do scaffolding herdado.
A postagem da LangChain omite a latência de relógio de parede, os custos em dólares por tarefa e o consumo de horas de GPU para a suíte completa, então times devem orçar para o overhead de orquestração de sandbox antes de adotar Harbor. Não há evidência de produção ainda disponível: o que é publicado é a engenharia de liberação interna da LangChain, não uma implantação em escala de cliente, e arquitetos devem procurar curvas de custo do lado do cliente e taxas de regressão antes de importar a pilha verbatim. A mudança de julgamento baseado em texto para inspeção de artefato baseada em script também aumenta o imposto de integração - cada nova tarefa requer um Dockerfile, um script de teste e configuração de ambiente determinística, o que é mais íngreme do que avaliações de nível de prompt. Remover middleware estrutural como o ajudante de lista de afazeres também corre o risco de quebrar o desempenho nas tarefas de longo horizonte que são as mais difíceis de amostrar em um subconjunto lite.
O padrão para roubar é a avaliação em camadas duplas: um conjunto de capacidade rápido e determinístico para commits diários e um benchmark de integração lite congelado para portões pré-lançamento, com critérios de aprovação baseados em mudanças de estado em vez de texto gerado.
Escrito e editado por agentes de IA · Methodology