A Apollo reduziu significativamente o tempo de desenvolvimento inicial ao lançamento em produção em aproximadamente 80-85%, reconstruindo seu assistente de IA de GTM em uma arquitetura de Agentes Planos, conforme detalhado em uma quebra de engenharia pela LangChain. Essa migração de uma hierarquia supervisora do LangGraph fornece insights sobre como aplanar hierarquias de agentes pode impactar a velocidade e a experiência do usuário em um ambiente SaaS ao vivo.
Anteriormente, o sistema dependia de um agente supervisor primário encaminhando solicitações para sub-agentes especializados, cada uma codificada rígida para etapas específicas, como prospecting, criação de sequência ou análise de entregabilidade. Adicionar um novo fluxo de trabalho exigia a criação de um novo sub-agente e sua integração ao gráfico supervisor, resultando em prompts de confirmação excessivos e iteração mais lenta. O novo design emprega Agentes Planos - uma estrutura baseada em LangGraph - para operar um agente plano que elabora seu próprio plano contra uma biblioteca de habilidades dinâmica. Quando a Apollo necessita de uma nova capacidade, um agente de meta-habilidade elabora o plano de arquitetura, que é revisto por um engenheiro sênior antes que outro agente o construa. A equipe considerou o SDK do Agente Claude da Anthropic, mas o rejeitou devido a preocupações sobre o bloqueio da pilha nos modelos da Anthropic; Agentes Planos mantém neutralidade do modelo, um requisito crítico para a equipe de engenharia.
Em termos de operações, a arquitetura supervisora inicialmente alcançou uma precisão de primeira passagem de 20-30% no desenvolvimento inicial, exigindo uma fase de avaliação estendida para superar um limiar de precisão de 80% antes do lançamento. A arquitetura plana melhorou as latências e eliminou a fricção nos prompts de confirmação inerentes à hierarquia. A observabilidade agora é gerenciada inteiramente através do LangSmith, consolidando um pipeline de depuração anteriormente fragmentado que exigia que os engenheiros cruzassem logs do GCS, MongoDB e vários sistemas downstream em um único ID de rastreamento de thread.
A pilha de avaliação interna da "AI Watchtower" da Apollo consiste em seis camadas. Pré-lançamento, 50-200 saídas são pontuadas em uma rubrica de 1-5 em três a cinco dimensões - precisão, tom, relevância - por dois revisores independentes. Testes de cenário ouro de ponta a ponta são realizados em cada PR afetando um prompt ou configuração do modelo, bem como em cada implantação. Em produção, o LangSmith captura prompts completos, contexto, chamadas de ferramentas, saídas e latência por solicitação. Pontuações agregadas do LLM como juiz, taxas de recusa e tendências de latência são amostradas continuamente; uma queda significativa dispara um desmonte de três camadas da categoria ao subcategoria ao segmento, com aumento temporário da amostragem para 50-100%. Um relatório de pulso semanal categoriza coortes por nível do plano, tamanho da empresa e vertical. Feedback negativo é encaminhado para uma fila de triagem diária em minutos, e uma taxa de 8% negativa sustentada em uma janela de tempo de sete dias é tratada como um incidente P1.
O assistente agora é headless, acessível como uma REST API para integrações de CRM, email e Slack, e oferece suporte a automações em segundo plano agendadas. O contexto é gerenciado por habilidade, em vez de em uma janela monolítica, com um orquestrador montando envelopes em tempo de execução. A postagem não aborda os possíveis custos de consistência ao trocar provedores de modelos devido à neutralidade do modelo ou como o agente de meta-habilidade lida com regressões entre versões de modelos. O rigor da avaliação de seis camadas é substancial, mas manter esse nível de escrutínio implica em seus próprios custos de latência e manutenção.
Para arquitetos que integram cadeias de ferramentas multi-etapas, a lição é uma biblioteca de habilidades plana regida por um SLA de qualidade automatizado rigoroso - trate uma taxa de rejeição de 8% do usuário como um incidente P1 e instrumente cada camada para garantir conformidade.
Escrito e editado por agentes de IA · Methodology