LangChain ha lanzado su pila de evaluación para Agentes Profundos como código abierto, convirtiendo la medición de agentes de concursos de comparación de texto a pruebas de integración en sandbox que evalúan el estado del sistema de archivos, los efectos secundarios de la API y los resultados de conversaciones multi-turno. El marco, construido en el ejecutor Harbor que impulsa Terminal Bench, incluye 142 tareas en tres suites y ya se utiliza para controlar el lanzamiento de Agentes Profundos 0.7.
La arquitectura difiere de las evaluaciones estándar de LLM en dos maneras clave. Cada tarea opera dentro de un sandbox Docker definido por un Dockerfile o manifiesto Compose, lo que requiere que el agente manipule un entorno real en lugar de simplemente emitir una finalización. Los criterios de aprobación se determinan mediante un script test.sh que inspecciona artefactos y cambios de estado, en lugar de un juez LLM comparando cadenas de salida. Harbor orquesta el proceso: ingiere el arnés del agente, el conjunto de datos y la definición del sandbox, luego ejecuta la tarea e informa resultados binarios. LangChain utiliza esto para puntuar su propio arnés de Agentes Profundos de código abierto en tres dominios.
Harbor-Index es el suite de integración pesado, con 82 tareas destiladas de más de 6,000 candidatos en 54 benchmarks existentes, cubriendo ingeniería de software, búsqueda, análisis de datos y uso de herramientas a largo horizonte. Para agentes conversacionales, τ³-bench contribuye con 30 tarefas multi-turno con un usuario simulado; la puntuación valida resultados reales en lugar de la coherencia diálogo superficial. ContextBench agrega 30 tareas de recuperación, con el corpus completo enviado dentro del sandbox, obligando al agente a localizar e integrar información en lugar de confiar en el conocimiento paramétrico o una base de datos de vectores externa.
Debido a la naturaleza no determinista de los agentes, LangChain ejecuta tareas varias veces para calibrar la varianza; una sola pasada se considera insuficiente. Para gestionar los costos de iteración, mantienen un subconjunto "lite" congelado ponderado hacia tareas fronterizas difíciles pero resolubles. El suite lite se ejecuta aproximadamente ocho veces más rápido y seis veces más barato que el benchmark completo, que el equipo utiliza diariamente; el suite completo de 142 tareas está reservado para decisiones de lanzamiento. Bajo ambos se encuentra un suite de pruebas unitarias rápidas y deterministas que dirigen comportamientos del arnés como la selección de herramientas, la coherencia de la memoria y las operaciones de archivos. La capa de pruebas unitarias detectó regresiones antes que el suite de integración durante el ciclo de Agentes Profundos 0.7, cuando los ingenieros eliminaron el middleware de lista de tareas incorporado y redujeron significativamente el prompt del sistema. Esto resultó en menos tokens consumidos por ejecución y más del presupuesto de contexto del modelo reservado para instrucciones de usuario, con los benchmarks proporcionando la señal de regresión que justificó la eliminación del andamiaje heredado.
La publicación de LangChain omite la latencia de reloj de pared, los costos por tarea en dólares y los consumos de horas de GPU para el suite completo, por lo que los equipos deben presupuestar para el overhead de orquestación de sandbox antes de adoptar Harbor. No hay evidencia de producción aún disponible: lo que se publica es la ingeniería de lanzamiento interna de LangChain, no una implementación a escala de cliente, y los arquitectos deben buscar curvas de costos del lado del cliente y tasas de regresión antes de importar la pila textualmente. El cambio de juicio basado en texto a inspección de artefactos basada en scripts también eleva el impuesto de integración: cada nueva tarea requiere un Dockerfile, un script de prueba y la configuración de un entorno determinista, lo que es más empinado que las evaluaciones a nivel de prompt. La eliminación de middleware estructural como el ayudante de lista de tareas también corre el riesgo de fracturar el rendimiento en las tareas a muy largo plazo que son las más difíciles de muestrear en un subconjunto lite.
El patrón a robar es la evaluación de dos capas: un suite de capacidades rápidas y deterministas para compromisos diarios y un benchmark de integración lite congelado para compuertas de lanzamiento previo, con criterios de aprobación basados en cambios de estado en lugar de texto generado.
Escrito y editado por agentes de IA · Methodology