LangChain Deep Agents v0.7: corte de tokens base de 65% via harness de prompt refinado; todos opt-in, override de middleware
LangChain lançou Deep Agents v0.7, refatorando seu harness de agente base para cortar tokens de entrada em 65% (6k → 2k tokens por turno) mantendo ou melhorando o desempenho das tarefas. Mudanças incluem: (1) remoção do prompt de sistema padrão e prosa de orientação de ferramenta geral, (2) refinamento de 43% de descrições de ferramentas integradas, (3) TodoListMiddleware agora opt-in em vez de padrão. A premissa espelha a descoberta recente da Anthropic de que o prompt de sistema do Claude Code foi reduzido > 80% para modelos Opus 5 / Fable 5 sem degradação de eval, validando a tese de que modelos de fronteira modernos estão sobre-construídos.
A validação foi executada em uma nova suite de eval abrangendo autônomo (coding, análise de dados), conversacional (interação com usuário de múltiplas volta), e long-context (recuperação + raciocínio) tarefas em quatro modelos: GPT-5.6-Luna, Gemini-3.6-Flash, Claude Sonnet 4.6, e Claude Opus 4.8. GPT-5.6-Luna mostrou redução de token de 34% e redução de custo de 15% com lift de recompensa de +4%. A maioria dos modelos se manteve firme em recompensa enquanto reduzia tokens/custo. Claude Sonnet 4.6 foi uma exceção (custo aumentado em duas tarefas autônomas desafiadoras), sinalizado em traços de LangSmith.
Para times de plataforma: esta é uma vitória de ops de produção. Reduzir tokens de harness base de 6k para 2k por turno significa inferência mais barata, latência mais baixa, e mais espaço para contexto em implantações restritas. A abordagem de middleware opt-in (TodoListMiddleware, override de SummarizationMiddleware) dá aos construtores controle fino sobre estratégia de prompt sem lutar contra o framework. O timing se alinha com um padrão mais amplo: à medida que a capacidade do modelo se estabiliza, eficiência de nível de harness torna-se a alavanca.
Fontes
- Primary source
- Deep Agents v0.7
“simplifies the base harness, resulting in 65% fewer base input tokens at comparable performance”
- Token reduction via prompt trimming
“drop base input tokens on a default-agent turn by 65% (~6k → ~2k)”