88% dos projetos de agentes de IA nunca alcançam a produção, de acordo com a Pesquisa CIO 2025, e projeções do Gartner prevêem que mais de 40% dos projetos de IA agente serão cancelados até 2027. Um tutorial KDD '26 de Grace Hui Yang et al., apoiado pela experiência de implantação da Bloomberg, Bayer, Salesforce AI Research e Microsoft Research, destaca a lacuna entre otimização de padrões e realidade de produção. O artigo argumenta que sistemas agente passaram de protótipos monolíticos baseados em prompts para arquiteturas multi-agente modulares mais rápido do que as práticas de avaliação se adaptaram, levando a pilhas de produção expostas a modos de falha que as tabelas de classificação estáticas não medem, como corrupção silenciosa de chamadas de ferramentas, erros em cascata entre gráficos de agentes e loops de retry que consumem orçamento enquanto parecem bem-sucedidos.
O tutorial examina essa evolução por meio de estudos de caso na análise financeira de dados autônoma na Bloomberg, na revisão de literatura biomédica na Bayer e na geração de código multi-agente na Salesforce e Microsoft Research. Trata a camada de LLM como um backend genérico de raciocínio, focando em padrões de orquestração em vez de pesos de modelo específicos ou infraestrutura de serviço. Para sobrevivência em produção, os autores recomendam uma pilha defensiva construída em pipelines de verificação que cross-checkam as saídas dos agentes, mecanismos de fallback acionados por limiares de confiança e portões de supervisão com humano no loop para ações irreversíveis. O tutorial enfatiza o rastreamento de chamadas de ferramentas e estado entre agentes, agora ancorado nas convenções semânticas de GenAI do OpenTelemetry, que atingiu status estável em semconv 1.29+. A percepção central é que um argumento corrompido de ferramenta na etapa dois pode silenciosamente envenenar todas as etapas subsequentes, mas a maioria dos padrões testa apenas a saída final.
A pesquisa da Zylos.ai indica que um agente de codificação pode consumir US$ 2 em chamadas de API em um bom dia e US$ 40 em um mau dia quando preso em um loop de retry, tornando a variação de custo por sessão um sinal de correção em vez de um inconveniente financeiro. Seu heurístico é investigar qualquer sessão que exceda 5× o custo mediano para seu tipo de recurso e tratar qualquer coisa acima de 50× como um loop sem controle. O tutorial KDD nomeia alucinações, deadlocks, deriva e erros em cascata como modos de falha de produção centrais, enquanto a corroboração da prática adiciona mau uso de ferramentas, perda de contexto, deriva de objetivos e degradação de qualidade silenciosa, onde o agente completa o fluxo de trabalho e retorna um resultado plausível que envenena sistemas downstream horas mais tarde.
A coordenação multi-agente introduz modos de falha que sistemas monolíticos evitam completamente. O tutorial sinaliza deadlocks entre agentes colaborativos, sobrecarga de sincronização de estado e a falta de protocolos de comunicação segura entre agentes como restrições de engenharia não resolvidas sob orçamentos de latência industrial e computação. A adaptação contínua permanece arriscada: um agente que atualiza seu comportamento com base no feedback de produção pode se desviar de seu perfil de segurança original sem validação contínua, e a explicabilidade da razão coletiva degrada à medida que mais agentes se juntam ao gráfico.
A lacuna de avaliação é tão severa quanto a arquitetônica. Injeção de prompt, classificado como a vulnerabilidade de LLM OWASP superior para 2025 na análise Trantorinc, é especialmente destrutivo nos sistemas agente porque um ataque bem-sucedido pode sequestrar o objetivo do agente, manipular suas chamadas de ferramentas e propagar comportamento malicioso pelo gráfico orquestrado. Os padrões estáticos não modelam ambientes de ferramentas adversárias ou estados de erro em cascata; o artigo do arXiv defende testes contínuos de robustez, confiabilidade e segurança em ambientes ao vivo em vez de otimização de tabela de classificação única.
Instrumente o custo por sessão contra um mediano a nível de recurso e trate qualquer pico de 5× como um incidente de correção antes que se torne um corte para o cliente.
Escrito e editado por agentes de IA · Methodology