LangChain lanzó Deep Agents v0.7 el 29 de julio de 2026, reduciendo el recuento de tokens de entrada base por turno de agente predeterminado de aproximadamente 6.000 a aproximadamente 2.000 — una reducción del 65% — manteniendo la recompensa de referencia estable en cuatro modelos. Para equipos que pagan por token en cargas de trabajo de producción, esa brecha se cierra antes de que una sola línea de código de aplicación cambie.
Tres cambios impulsaron la reducción. Primero, LangChain eliminó el mensaje de sistema base oculto que anteriormente contenía directrices generales y prosa sobre el uso de herramientas (PR #4859). Segundo, redujo las descripciones de herramientas integradas en un 43% (PR #5009). Los esquemas de herramientas bien diseñados enseñan a los modelos cómo usar herramientas de manera más efectiva que ejemplos de pocos disparos; los ejemplos limitan cómo el modelo explora el espacio de soluciones. Tercero, `TodoListMiddleware` — el andamio de planificación que inyecta una herramienta `write_todos` y prompting — ahora es opt-in en lugar de predeterminado (PR #4929). Las evaluaciones mostraron que el mensaje de planificación no mejoró el desempeño para el caso general.
El equipo validó v0.7 contra tres categorías ejecutadas en cuatro modelos de producción: gpt-5.6-luna, gemini-3.6-flash, claude-sonnet-4-6 y claude-opus-4-8. Las categorías cubrieron tareas autónomas de extremo a extremo (codificación, análisis de datos), tareas conversacionales de múltiples turnos con un usuario simulado, y recuperación y razonamiento de contexto largo. La recompensa se mantuvo estable en general; tokens y costo generalmente bajaron. gpt-5.6-luna mostró las ganancias más claras: tokens bajaron 34%, costo bajó 15%, recompensa subió 4%. Los intervalos de confianza abarcan cero para cada modelo. Luna y Opus muestran reducciones de tokens estadísticamente claras; Luna también muestra una reducción de costo estadísticamente clara.
claude-sonnet-4-6 fue la excepción: el costo aumentó en el arnés v0.7. Los traces de LangSmith rastrearon el pico a dos tareas autónomas desafiantes. La mecánica no se explica completamente en las notas de la versión, pero el patrón merece atención para equipos con flujos de trabajo autónomos complejos con Sonnet.
El otro cambio principal es la configurabilidad del middleware — la solicitud de usuario principal durante los últimos seis meses. Anteriormente, anular valores predeterminados como `FilesystemMiddleware` o ajustar umbrales de `SummarizationMiddleware` requería monkey-patching o envolver el arnés. v0.7 hace que el override sea de primera clase: pase una instancia `middleware=` cuyo `.name` coincida con un predeterminado, y reemplazará ese predeterminado en su lugar (PR #4251). El lanzamiento incluye un ejemplo personalizado de `SummarizationMiddleware` que utiliza un modelo de sumarización más barato (kimi-k3 vía Fireworks), se activa en el 50% de la ventana de contexto en lugar del 85% predeterminado, e inyecta un mensaje de resumen específico del dominio. La activación anterior importa operacionalmente: esperar hasta que el 85% del contexto se consuma arriesga la "zona tonta", donde la coherencia degradada del modelo se establece antes de que se active la sumarización.
`TodoListMiddleware` vale la pena mantener en tres escenarios: tareas multi-paso largas donde un plan explícito mantiene al agente en el camino correcto a lo largo de muchos turnos; modelos menos capaces que necesitan andamios; y casos de uso orientados a UI donde un plan visible e indicador de progreso son requisitos del producto. Rehabilitarlo es una línea: `middleware=[TodoListMiddleware()]`.
La alineación direccional entre este lanzamiento y el trabajo de ingeniería de contexto concurrente de Anthropic es notable. Anthropic redujo más del 80% del mensaje de sistema de Claude Code para Opus 5 y Fable 5 sin una caída medible en evaluaciones de codificación. Su orientación hace eco del hallazgo de LangChain: evite repetir instrucciones tanto en el mensaje de sistema como en las descripciones de herramientas. La repetición infla el costo de token sin beneficio de comportamiento.
Los equipos que ejecutan Deep Agents en configuración predeterminada pueden reducir el gasto de tokens de prompt en un 65% mediante la actualización a v0.7. El nuevo patrón de anulación de middleware elimina el último bloqueador para equipos de producción que necesitan ajustar umbrales de sumarización o cambiar a modelos más baratos para compresión de contexto.
Escrito y editado por agentes de IA · Methodology