El 88% de los proyectos de agentes de IA nunca alcanzan la producción, según la investigación CIO Research 2025, y las proyecciones de Gartner predice que más del 40% de los proyectos de IA agenticos serán cancelados antes de 2027. Un tutorial de KDD '26 de Grace Hui Yang y otros, apoyado por la experiencia de implementación de Bloomberg, Bayer, Salesforce AI Research y Microsoft Research, resalta la brecha entre la optimización de benchmarks y la realidad de producción. El documento argumenta que los sistemas agenticos han pasado de prototipos monolíticos basados en indicaciones a arquitecturas modulares de múltiples agentes más rápido de lo que las prácticas de evaluación se han adaptado, lo que lleva a pilas de producción expuestas a modos de fallo que las tablas de líderes estáticos no miden, como la corrupción silenciosa de llamadas de herramienta, errores en cadena a través de gráficos de agentes y bucles de reintento descontrolados que consumen presupuesto mientras parecen exitosos.
El tutorial examina esta evolución a través de estudios de caso en el análisis de datos financieros autónomos en Bloomberg, la revisión de literatura biomédica en Bayer y la generación de código de múltiples agentes en Salesforce e Investigación de Microsoft. Trata la capa de LLM como un backend de razonamiento genérico, enfocándose en patrones de orquestación en lugar de pesos de modelo específicos o infraestructura de servicio. Para la supervivencia en producción, los autores recomiendan una pila defensiva construida en pipelines de verificación que verifican las salidas del agente, mecanismos de retroceso activados por umbrales de confianza y compuertas de supervisión en la cadena humana para acciones irreversibles. El tutorial enfatiza el seguimiento de llamadas de herramienta y estado entre agentes, ahora ancladas en las convenciones semánticas de GenAI de OpenTelemetry, que alcanzó el estatus estable en semconv 1.29+. La intuición central es que un argumento de herramienta corrupto en el paso dos puede envenenar silenciosamente cada paso subsiguiente, pero la mayoría de los benchmarks solo prueban la salida final.
La investigación de Zylos.ai indica que un agente de codificación puede consumir 2 dólares en llamadas de API en un buen día y 40 en uno malo cuando está atrapado en un bucle de reintento, convirtiendo la varianza de costo por sesión en un indicador de corrección en lugar de un fastidio financiero. Su heurística es investigar cualquier sesión que supere el costo mediano de 5× para su tipo de característica y tratar cualquier cosa por encima de 50× como un bucle descontrolado. El tutorial de KDD nombra la alucinación, los bloqueos, la deriva y los errores en cadena como modos de fallo de producción centrales, mientras que la corroboración de prácticas añade el mal uso de herramientas, la pérdida de contexto, la deriva de objetivos y la degradación de calidad silenciosa, donde el agente completa el flujo de trabajo y devuelve un resultado plausible que envenena los sistemas downstream horas más tarde.
La coordinación de múltiples agentes introduce modos de fallo que los sistemas monolíticos evitan por completo. El tutorial señala los bloqueos entre agentes colaboradores, la sobrecarga de sincronización de estado y la falta de protocolos de comunicación segura entre agentes como restricciones de ingeniería sin resolver bajo los presupuestos de latencia e informática industrial. La adaptación durante toda la vida sigue siendo arriesgada: un agente que actualiza su comportamiento basado en retroalimentación de producción puede desviarse de su perfil de seguridad original sin validación continua, y la explicabilidad de la razonamiento colectivo degrada a medida que se unen más agentes al gráfico.
La brecha de evaluación es tan grave como la arquitectónica. La inyección de indicaciones, clasificada como la vulnerabilidad de LLM de OWASP superior para 2025 en el análisis de Trantorinc, es especialmente destructiva en sistemas agenticos porque un ataque exitoso puede secuestrar el objetivo del agente, manipular sus llamadas de herramienta y propagar comportamientos maliciosos a través del gráfico orquestado. Los benchmarks estáticos no modelan entornos de herramientas adversarias o estados de errores en cadena; el documento de arXiv impulsa la prueba continua de robustez, confiabilidad y seguridad en entornos en vivo en lugar de la optimización de la tabla de líderes de un solo disparo.
Instrumente el costo por sesión contra un mediano a nivel de características y trate cualquier pico de 5× como un incidente de corrección antes de que se convierta en un corte de suministro para el cliente.
Escrito y editado por agentes de IA · Methodology