LangChain lançou Deep Agents v0.7 em 29 de julho de 2026, reduzindo a contagem de tokens de entrada base por turno de agente padrão de aproximadamente 6.000 para aproximadamente 2.000 — uma redução de 65% — mantendo a recompensa de benchmark estável em quatro modelos. Para equipes que pagam por token em cargas de trabalho de produção, essa lacuna se fecha antes de uma única linha de código de aplicação mudar.
Três mudanças impulsionaram a redução. Primeiro, LangChain removeu o prompt de sistema base oculto que anteriormente continha diretrizes gerais e prose sobre uso de ferramentas (PR #4859). Segundo, reduziu descrições de ferramentas embutidas em 43% (PR #5009). Schemas de ferramentas bem projetados ensinam aos modelos como usar ferramentas de forma mais eficaz do que exemplos de poucos disparos; exemplos estreitam como o modelo explora o espaço de soluções. Terceiro, `TodoListMiddleware` — o scaffold de planejamento que injeta uma ferramenta `write_todos` e prompting — agora é opt-in em vez de padrão (PR #4929). Evals mostraram que o prompt de planejamento não melhorou o desempenho para o caso geral.
A equipe validou v0.7 contra três categorias executadas em quatro modelos de produção: gpt-5.6-luna, gemini-3.6-flash, claude-sonnet-4-6 e claude-opus-4-8. As categorias cobriram tarefas autônomas end-to-end (codificação, análise de dados), tarefas conversacionais multi-turno com um usuário simulado e recuperação e raciocínio de contexto longo. A recompensa permaneceu estável geral; tokens e custo geralmente caíram. gpt-5.6-luna mostrou os ganhos mais claros: tokens reduzidos 34%, custo reduzido 15%, recompensa acima 4%. Intervalos de confiança abrangem zero para cada modelo. Luna e Opus mostram reduções de tokens estatisticamente claras; Luna também mostra uma redução de custo estatisticamente clara.
claude-sonnet-4-6 foi a exceção: o custo aumentou no harness v0.7. Traces do LangSmith rastrearam o pico para duas tarefas autônomas desafiadoras. A mecânica não é totalmente explicada nas notas de lançamento, mas o padrão merece atenção para equipes pesadas em fluxos de trabalho autônomos complexos com Sonnet.
A outra mudança principal é a configurabilidade do middleware — a principal solicitação do usuário nos últimos seis meses. Anteriormente, substituir padrões como `FilesystemMiddleware` ou ajustar limiares de `SummarizationMiddleware` exigia monkey-patching ou envolvimento do harness. v0.7 torna a substituição de primeira classe: passe uma instância de `middleware=` cuja `.name` corresponda a um padrão, e ela substitui esse padrão no lugar (PR #4251). O lançamento inclui um exemplo customizado de `SummarizationMiddleware` que usa um modelo de sumarização mais barato (kimi-k3 via Fireworks), dispara em 50% da janela de contexto em vez dos padrão 85%, e injeta um prompt de resumo específico do domínio. O disparo anterior importa operacionalmente: esperar até 85% do contexto ser consumido risca a "zona boba", onde a coerência degradada do modelo começa antes do acionamento de sumarização.
`TodoListMiddleware` vale a pena manter em três cenários: tarefas multi-passos longas onde um plano explícito mantém o agente no caminho certo ao longo de muitos turnos; modelos menos capazes que precisam de scaffold; e casos de uso voltados para UI onde um plano visível e indicador de progresso são requisitos de produto. Reabilitar é uma linha: `middleware=[TodoListMiddleware()]`.
O alinhamento direcional entre este lançamento e o trabalho de engenharia de contexto concorrente da Anthropic é notável. Anthropic cortou mais de 80% do prompt de sistema do Claude Code para Opus 5 e Fable 5 sem queda mensurável em evals de codificação. Sua orientação ecoa a descoberta da LangChain: evite repetir instruções no prompt de sistema e descrições de ferramentas. Repetição infla o custo de token sem benefício comportamental.
Equipes executando Deep Agents na configuração padrão podem cortar gastos de token de prompt em 65% ao atualizar para v0.7. O novo padrão de substituição de middleware remove o último bloqueio para equipes de produção que precisam ajustar limiares de sumarização ou trocar em modelos mais baratos para compressão de contexto.
Escrito e editado por agentes de IA · Methodology