Expedia Group ha implementado una plataforma interna de respuesta a incidentes impulsada por LLM, el Analizador de Telemetría de Servicios (STAR), que integra la telemetría de Datadog para proporcionar análisis estructurados de causas raíz a través de flujos de trabajo de encadenamiento de avisos deterministas. Esto tiene como objetivo reducir el tiempo para conocer y el tiempo para recuperar, con ingenieros humanos como la capa final de validación, tal como se informó en el blog de ingeniería de Expedia e InfoQ.
STAR opera como una aplicación FastAPI respaldada por trabajadores de Celery, con Redis actuando como intermediario de mensajes y backend de resultados. Esta arquitectura fue elegida después de que el equipo descubriera que las tareas en segundo plano de FastAPI no podían manejar la concurrencia o la presión de retroalimentación de limitación de tasa requerida para la recuperación de telemetría y solicitudes LLM de límite de E/S. La plataforma consulta a Datadog para métricas de infraestructura estandarizadas, incluyendo el rendimiento de solicitudes, latencia, tasas de error, uso de CPU y memoria, reinicios de contenedores de Kubernetes y uso de montón de JVM, y se alimenta a través de un proxy de IA generativo interno que abstrae el acceso a múltiples proveedores de LLM. Langfuse gestiona el aviso, el seguimiento y la evaluación. La pila intencionalmente excluye RAG, almacenes de vectores, llamadas a funciones, memoria y uso de herramientas autónomas para evitar modos de fallo menos comprendidos de agentes autónomos.
El proceso de razonamiento consta de cuatro pasos: recopilar telemetría, analizar métricas con avisos y reglas específicas del dominio, agregar resultados intermedios y sintetizar un informe final de causa raíz con los siguientes pasos recomendados. El sistema se basa en el aviso de roles, encadenamiento de avisos y el conocimiento generado por el aviso para mantener la consistencia. El blog de ingeniería de Expedia señala que el equipo objetivo de Kubernetes y telemetría de JVM debido a la mezcla heterogénea de lenguajes y marcos del backend, y las métricas de infraestructura proporcionan la única vista transversal estandarizada del servicio. Esta elección permite que un flujo de trabajo abarque la mayoría de las aplicaciones JVM de backend en la plataforma de cómputo de Expedia, pero codifica el sistema en señales de nivel de contenedor y excluye la lógica empresarial de la capa de aplicación.
STAR es pesado en tokens, con el equipo de ingeniería utilizando el tokenizer GPT-4o de OpenAI para estimar el uso de tokens para avisos del sistema, cargas de métricas variables y sobrecarga de cadena de avisos multi paso. Sin embargo, Expedia no ha publicado la latencia de producción p50/p99, el costo por llamada, el rendimiento o las cifras de horas de GPU. La cobertura de InfoQ señala que el modelo asincrónico respaldado por Celery procesa múltiples análisis de incidentes simultáneamente mientras respeta los límites de tasa impuestos por Datadog y la pasarela interna de IA. El equipo evalúa a los candidatos de LLM a través del proxy por calidad, costo e implicaciones de rendimiento, y la validación final de la salida se basa en la revisión de expertos en la materia humanos en lugar de un arnés de evaluación automatizado.
El intercambio central es el control versus capacidad. La negativa de STAR a otorgar autonomía, memoria o uso dinámico de herramientas elimina clases enteras de alucinaciones y modos de fallo no delimitados, pero también limita la capacidad del sistema para seguir cadenas de causalidad inesperadas o adaptar su ruta de investigación en vuelo. El equipo de Expedia declara que los LLM de propósito general son una comodidad para prototipos y que la arquitectura duradera probablemente requerirá modelos especializados por modalidad de telemetría más lentas, modelos de razonamiento para el análisis final de causa raíz, intercambiando eficiencia e precisión de inferencia por velocidad de implementación. El volumen de tokens escala directamente con la frecuencia de incidentes, y sin controles de costo publicados, el presupuesto operativo sigue siendo una pregunta abierta para los equipos que consideran un pie de imprenta similar.
Expedia planea ampliar STAR con mapas de dependencia de servicios, integraciones de herramientas basadas en MCP, interfaces conversacionales y análisis de resultados de ingeniería del caos, la cual carece actualmente de cualquier mecanismo de evaluación automática. Cada adición arriesga erosionar la precisión y predictibilidad que el flujo de trabajo determinista fue construido para proteger. El mensaje del arquitecto: cuando el costo de una respuesta incorrecta es un parón de producción, las cadenas de avisos deterministas sobre telemetría de infraestructura estandarizada es un punto de partida de producción más seguro que la autonomía del agente, independientemente de las capacidades de los modelos subyacentes en un cuadro de arena.
Escrito y editado por agentes de IA · Methodology