LangChain Deep Agents v0.7: reducción de tokens base del 65% mediante arnés de solicitud refinado; todos opt-in, anulación de middleware
LangChain lanzó Deep Agents v0.7, refactorizando su arnés de agente base para reducir tokens de entrada en un 65% (6k → 2k tokens por turno) manteniendo o mejorando el rendimiento de las tareas. Los cambios incluyen: (1) eliminación de la solicitud del sistema predeterminada y la prosa de orientación de herramientas general, (2) reducción del 43% de las descripciones de herramientas integradas, (3) TodoListMiddleware ahora es opt-in en lugar del valor predeterminado. La premisa refleja el hallazgo reciente de Anthropic de que la solicitud del sistema de Claude Code se redujo en más del 80% para los modelos Opus 5 / Fable 5 sin degradación de evaluación, validando la tesis de que los modelos fronterizos modernos están sobre-andamiados.
La validación se ejecutó en una nueva suite de evaluación que abarca tareas autónomas (codificación, análisis de datos), conversacionales (interacción multiturno con el usuario) y long-context (recuperación + razonamiento) en cuatro modelos: GPT-5.6-Luna, Gemini-3.6-Flash, Claude Sonnet 4.6, y Claude Opus 4.8. GPT-5.6-Luna mostró una reducción de tokens del 34% y una reducción de costos del 15% con un aumento de recompensa del +4%. La mayoría de los modelos se mantuvieron firmes en recompensa mientras reducían tokens/costos. Claude Sonnet 4.6 fue una excepción (costo aumentado en dos tareas autónomas desafiantes), señalado en trazas de LangSmith.
Para equipos de plataforma: esta es una victoria de ops de producción. Reducir tokens de arnés base de 6k a 2k por turno significa inferencia más barata, latencia más baja, y más espacio para contexto en implementaciones restringidas. El enfoque de middleware opt-in (TodoListMiddleware, anulación de SummarizationMiddleware) ofrece a los constructores un control fino sobre la estrategia de solicitud sin luchar contra el marco. El cronograma se alinea con un patrón más amplio: a medida que la capacidad del modelo se estabiliza, la eficiencia de nivel de arnés se convierte en la palanca.
Fuentes
- Primary source
- Deep Agents v0.7
“simplifies the base harness, resulting in 65% fewer base input tokens at comparable performance”
- Token reduction via prompt trimming
“drop base input tokens on a default-agent turn by 65% (~6k → ~2k)”