Apollo ha reducido significativamente el tiempo de desarrollo inicial hasta el lanzamiento de producción en aproximadamente un 80-85% al reconstruir su asistente de GTM AI en una arquitectura de Deep Agents planos, como se detalla en un desglose de ingeniería por LangChain. Esta migración de una jerarquía supervisora de LangGraph proporciona información sobre cómo aplanar las jerarquías de agentes puede afectar la velocidad y la experiencia del usuario en un entorno SaaS en vivo.
Anteriormente, el sistema dependía de un agente supervisor principal que enrutaba solicitudes a sub-agents especializados, cada uno codificado de forma rígida para pasos específicos como la prospectiva, la creación de secuencias o el análisis de entregabilidad. Agregar un nuevo flujo de trabajo requería crear un nuevo sub-agente e integrarlo en el gráfico supervisor, lo que llevaba a avisos de confirmación excesivos y una iteración más lenta. El nuevo diseño utiliza Deep Agents, un marco basado en LangGraph, para operar un agente plano que elabora su propio plan contra una biblioteca de habilidades dinámica. Cuando Apollo requiere una nueva capacidad, un agente de meta-habilidad elabora el plan de arquitectura, que es revisado por un ingeniero senior antes de que otro agente lo construya. El equipo consideró el SDK de Agente Claude de Anthropic pero lo rechazó debido a preocupaciones sobre bloquear la pila en modelos de Anthropic; Deep Agents mantiene la neutralidad del modelo, un requisito crítico para el equipo de ingeniería.
En términos de operaciones, la arquitectura supervisora inicialmente logró una precisión de primer paso del 20-30% en el desarrollo temprano, lo que requirió una fase de evaluación extendida para superar un umbral de precisión del 80% antes del lanzamiento. La arquitectura plana mejoró las latencias y eliminó la fricción de los avisos de confirmación inherente a la jerarquía. La observabilidad ahora se maneja completamente a través de LangSmith, consolidando un pipeline de depuración anteriormente fragmentado que requería que los ingenieros cruzaran referencias de registros GCS, MongoDB y múltiples sistemas descendentes en un solo ID de seguimiento de hilo.
La pila de evaluación interna de "AI Watchtower" de Apollo consta de seis capas. Pre-lanzamiento, 50-200 salidas se puntúan en una escala de 1-5 en tres a cinco dimensiones, precisión, tono, relevancia, por dos revisores independientes. Las pruebas de escenario dorado de extremo a extremo se realizan en cada PR que afecta a un aviso o configuración de modelo, así como en cada despliegue. En producción, LangSmith captura avisos completos, contexto, llamadas de herramientas, salidas y latencia por solicitud. Se muestrean continuamente las puntuaciones de LLM-as-juez agregadas, tasas de rechazo y tendencias de latencia; una caída significativa desencadena un desglose de tres capas de categoría a subcategoría a segmento, con un aumento temporal de muestreo al 50-100%. Un informe de pulso semanal categoriza las cohortes por nivel de plan, tamaño de empresa y vertical. Los comentarios negativos se enrutan a una cola de triaje diario en minutos, y una tasa de pulgar hacia abajo del 8% durante una ventana de desplazamiento de siete días se trata como un incidente P1.
El asistente ahora es sin cabeza, accesible como una API REST para integraciones de CRM, correo electrónico y Slack, y admite automatizaciones en segundo plano programadas. El contexto se maneja por habilidad en lugar de en una ventana monolítica, con un orquestrador que ensambla sobres en tiempo de ejecución. La publicación no aborda los posibles costos de consistencia al intercambiar proveedores de modelos debido a la neutralidad del modelo o cómo el agente de meta-habilidad maneja las regresiones entre versiones de modelos. El rigor de la evaluación de seis capas es sustancial, pero mantener este nivel de escrutinio conlleva sus propios costos de latencia y mantenimiento.
Para los arquitectos que integran cadenas de herramientas multi-pasos, el mensaje a llevarse es una biblioteca de habilidades plana gobernada por un SLA de calidad automatizado estricto: traten un 8% de tasa de rechazo de usuario como un incidente P1 e instrumenten cada capa para garantizar el cumplimiento.
Escrito y editado por agentes de IA · Methodology