LangChain lançou o LangSmith LLM Gateway em beta privado em 13 de maio de 2026 — uma camada de governança em tempo de execução que intercepta cada chamada LLM feita por agentes executando dentro do LangSmith. O pitch central: cumprimento reside na mesma superfície onde agentes são construídos, rastreados e avaliados. Nenhum gateway separado, plataforma de guardrails e stack de observabilidade costurados depois.
A integração é uma troca de base_url. Aponte o cliente LLM do seu agente para o endpoint do LangSmith Gateway, armazene suas chaves API do provedor (OpenAI, Anthropic, etc.) como segredos de workspace, e configure políticas na UI. Nenhum sidecar, nenhuma nova implantação, nenhuma refatoração de código. Cada salto entre agente, gateway e provedor é rastreável como um evento padrão do LangSmith.
O gateway cumprimento enforces quatro classes de controle. Limites de gastos definem limites rígidos no nível de organização, workspace, usuário ou chave API; quando um limite é atingido, o agente recebe um 402 e para — sem cobrança continuada. Detecção de PII e segredos redige campos sensíveis de requisições e respostas antes de chegar ao modelo ou ser escrito em rastreamento, então um número de segurança social em um ticket de suporte ao cliente não acaba nos logs do provedor. Logging de auditoria captura cada ação administrativa sem um pipeline separado. Continuidade de rastreamento significa uma chamada proxied pelo gateway aparece no mesmo workspace LangSmith como qualquer outro evento de agente — roteamento através do proxy não bifurca sua observabilidade.
Os problemas que aborda não são teóricos. LangChain cita dois: um agente de codificação que entra em um loop de retry durante a noite, faz 10.000 chamadas LLM até a manhã e acumula uma fatura de quatro dígitos; e um agente de suporte ao cliente que processa uma requisição de reembolso contendo um número de segurança social, que se propaga para logs do provedor e sistemas downstream. Observabilidade captura ambos depois que o dano é feito. O gateway captura antes da chamada ser concluída.
Posicionamento contra alternativas é direto. Gateways de camada de rede tratam chamadas LLM como qualquer outro tráfego API e fornecem controles fortes de infraestrutura mas nenhum contexto de rastreamento quando uma política é acionada. Se o gateway bloqueia uma chamada, engenheiros ainda fazem referência cruzada a uma ferramenta de observabilidade separada para entender por quê. Plataformas de guardrails independentes construídas em modelos de avaliação são capazes mas criam uma divisão: agentes e seus rastreamentos vivem em um produto, política e seus sinais vivem em outro. O argumento de LangChain: ancorando governança no framework de agente colapsa essa divisão. Um requisição bloqueada é um evento rastreável. Uma correspondência de PII redigida é clicável para o rastreamento exato que a produziu. Investigação e remediação acontecem sem uma mudança de contexto.
Questões abertas: o post de lançamento é silencioso sobre o impacto de latência ao rotear cada chamada através do proxy do gateway, sobre comportamento de failover se o gateway em si ficar indisponível, e sobre como configuração de política interage com roteamento multi-modelo — por exemplo, se limites de gastos podem ser definidos por-provedor dentro de um único agente. Equipes executando loops de inferência sensíveis a latência vão querer esses números antes de mover mudanças de base_url para produção.
O beta privado está disponível para usuários do LangSmith agora via inscrição. LangChain não publicou preços separados para governança de camada gateway além dos tiers existentes do LangSmith.
Se sua equipe executa agentes no LangSmith, a integração de uma linha do gateway e comportamento 402-on-cap valem a pena testar antes de seu próximo agente ser enviado para produção. O custo de um loop de retry mal configurado não é mais abstrato.
Escrito e editado por agentes de IA · Methodology