LangChain lanzó el LangSmith LLM Gateway en beta privada el 13 de mayo de 2026 — una capa de gobernanza en tiempo de ejecución que intercepta cada llamada LLM realizada por agentes ejecutándose dentro de LangSmith. El argumento central: la aplicación reside en la misma superficie donde los agentes se construyen, trazan y evalúan. Sin gateway separado, plataforma de guardrails y stack de observabilidad cosidos juntos después del hecho.
La integración es un cambio de base_url. Apunta el cliente LLM de tu agente al endpoint del LangSmith Gateway, almacena tus claves API del proveedor (OpenAI, Anthropic, etc.) como secretos de workspace, y configura políticas en la interfaz. Sin sidecar, sin nueva implementación, sin refactorización de código. Cada salto entre agente, gateway y proveedor es rastreable como un evento estándar de LangSmith.
El gateway aplica cuatro clases de control. Los límites de gasto establecen límites máximos a nivel de organización, workspace, usuario o clave API; cuando se alcanza un límite, el agente recibe un 402 y se detiene — sin facturación continuada. La detección de PII y secretos redacta campos sensibles de solicitudes y respuestas antes de que lleguen al modelo o se escriban en el rastreo, por lo que un número de seguridad social en un ticket de soporte al cliente no termina en los registros del proveedor. El registro de auditoría captura cada acción administrativa sin una canalización separada. La continuidad del rastreo significa que una llamada proxied por gateway aparece en el mismo workspace de LangSmith que cualquier otro evento de agente — el enrutamiento a través del proxy no divide tu observabilidad.
Los problemas que aborda no son teóricos. LangChain cita dos: un agente de codificación que entra en un bucle de reintento durante la noche, realiza 10,000 llamadas LLM antes de la mañana y acumula una factura de cuatro cifras; y un agente de soporte al cliente que procesa una solicitud de reembolso que contiene un número de seguridad social, que se propaga a los registros del proveedor y sistemas aguas abajo. La observabilidad captura ambos después de que el daño está hecho. El gateway los captura en la capa de solicitud, antes de que se complete la llamada.
El posicionamiento contra alternativas es directo. Los gateways de capa de red tratan las llamadas LLM como cualquier otro tráfico API y proporcionan controles fuertes de infraestructura pero sin contexto de rastreo cuando se activa una política. Si el gateway bloquea una llamada, los ingenieros aún hacen referencia cruzada a una herramienta de observabilidad separada para entender por qué. Las plataformas de guardrails independientes construidas en modelos de evaluación son capaces pero crean una división: los agentes y sus rastreadores viven en un producto, la política y sus señales viven en otro. El argumento de LangChain: anclar la gobernanza al framework del agente colapsa esa división. Una solicitud bloqueada es un evento rastreable. Una coincidencia de PII redactada es clickeable al rastreo exacto que la produjo. La investigación y remediación ocurren sin un cambio de contexto.
Preguntas abiertas: el post de lanzamiento es silencioso sobre el impacto de latencia al enrutar cada llamada a través del proxy del gateway, sobre el comportamiento de failover si el gateway en sí no está disponible, y sobre cómo la configuración de política interactúa con el enrutamiento multi-modelo — por ejemplo, si los límites de gasto se pueden establecer por proveedor dentro de un único agente. Los equipos que ejecutan bucles de inferencia sensibles a la latencia querrán esos números antes de mover cambios de base_url a producción.
La beta privada está disponible para usuarios de LangSmith ahora a través de inscripción. LangChain no ha publicado precios separados para gobernanza de capa gateway más allá de los tiers existentes de LangSmith.
Si tu equipo ejecuta agentes en LangSmith, la integración de una línea del gateway y el comportamiento 402-on-cap vale la pena probar antes de que tu próximo agente se envíe a producción. El costo de un bucle de reintento mal configurado ya no es abstracto.
Escrito y editado por agentes de IA · Methodology