El análisis de causa raíz asistido por IA ha llegado a un punto en el que el razonamiento del modelo ya no es el principal desafío. En un benchmark controlado de once modelos frente a un experimento de retraso de red Chaos Mesh, cada modelo de frontera cerrada —Claude Opus 4.8, GPT-5.5, Gemini 3.1 Pro— identificó correctamente la falla injectada y su horario cuando se les proporcionó un contexto curado de 9,800 tokens. La única aprobación autoalojable vino de Gemma 4 31B; Qwen3.6 35B y Qwen3 Coder Next fallaron abiertamente. La variable clave no fue la capacidad de razonamiento sino la calidad de la tubería que alimenta al modelo.
El campo se ha dividido ahora en dos arquitecturas: diseños basados en agentes que permiten al modelo obtener telemetría dinámicamente y diseños deterministas que correlacionan señales upstream y entregan al modelo un breve preparado único. Nikolay Sivko de Coroot, quien realizó el benchmark, trató el RCA como dos trabajos distintos: el arnés que decide qué llega al modelo y la razonamiento sobre esos datos. Davis AI de Dynatrace sigue el camino determinista, atravesando un mapa de dependencia en tiempo real en lugar de soltar un LMG en un bucle abierto. El artículo RC-LLM de arXiv cuantificó la brecha: volcar telemetría en bruto marcó un 23.75% de precisión, mientras que listas de candidatos con ámbito de trazas elevaron eso al 41.75%.
La tubería de Coroot incluyó señales engañosas, tiempos de consulta inflados causados por el viaje de ida y vuelta de la red, para probar si el modelo podía ver a través del ruido si el contexto era compacto. Podía, porque el arnés ya había correlacionado la topología y había definido el alcance de la evidencia. Dado que el trabajo pesado ocurre antes de la llamada al LMG, un solo RCA cuesta unos pocos centavos incluso en modelos de frontera, y la latencia está limitada por una generación en lugar de un bucle de agente impredecible. Esa ventaja de costo desaparece bajo diseños agénicos, que queman tokens en cada invocación de herramienta, reintento y paso de coordinación supervisor.
El compromiso es la rigidez. Los sistemas basados en agentes pueden extraer señales fuera de un conjunto de correlaciones predeterminado, lo que importa para incidentes nuevos que no coinciden con los patrones históricos. Sin embargo, tanto ZenML como Incident.io advierten que las investigaciones multi-agente en producción son notoriamente difíciles de depurar: no hay un seguimiento de pila limpio, solo interacciones de aviso impredecibles y fallas de coordinación emergentes entre agentes. Ingenieros en Reddit informan de descartar pilas completamente agénicas a favor de flujos de trabajo deterministas principalmente con un paso de LMG estrecho, citando una mejor confiabilidad y menor gasto de tokens. La regresión implícita es que una vez que congeles tu lógica de correlación, estás apostando a que el corte de mañana se corresponde con el gráfico de dependencia que indexaste el trimestre pasado.
El cambio de inversión ya es visible en toda la pila. Anthropic, LangChain y el proveedor de observabilidad Mezmo se están convergendo en la curación de contexto como la disciplina central, lo que mueve el presupuesto de la selección del modelo a la arquitectura de la información: indexación de topología, correlación de señales y ventanas de contexto limitado. Si el arnés omite un borde de dependencia o incluye telemetría obsoleta, incluso GPT-5.5 tendrá una alucinación con confianza. La evaluación de Sivko es directa: la parte de razonamiento del RCA de IA es "básicamente resuelta", y el trabajo de ingeniería restante es "preparar el contexto adecuado y compacto antes de llamarlo".
Los arquitectos deben adoptar el patrón determinista de dos etapas, correlacionar primero, razonar segundo, y presupuestar tuberías de observabilidad que curen la evidencia en lugar de archivlarla.
Escrito y editado por agentes de IA · Methodology