Plataforma STAR de Expedia utiliza LLMs para análisis de causa raíz de incidentes; flujos de trabajo determinísticos reducen tiempo medio de recuperación
Expedia Group implementó Service Telemetry Analyzer (STAR), una plataforma de observabilidad asistida por IA diseñada para acelerar la investigación de incidentes de producción. En lugar de agentes autónomos, STAR utiliza flujos de trabajo determinísticos que combinan métricas de Datadog con análisis impulsado por LLM: la telemetría se recopila, se analiza mediante avisos específicos del dominio, se consolida en hallazgos intermedios y se resume en un informe final con causas raíces y próximos pasos. El objetivo: reducir tiempo-para-conocer (TTK) y tiempo-para-recuperar (TTR) mientras se mantiene a los humanos responsables de la validación y la toma de decisiones.
STAR se crea como una aplicación FastAPI que integra Datadog para métricas de servicio y la puerta de IA generativa interna de Expedia que administra el acceso a LLM. El sistema analiza métricas de infraestructura en servicios basados en Kubernetes y aplicaciones JVM: rendimiento de solicitud, latencia, tasas de error (HTTP/gRPC/GraphQL), utilización de CPU/memoria, reinicios de contenedores, fallas de sonda, estado de montón Java y recopilación de basura. Expedia utiliza telemetría de infraestructura estandarizada para mantener consistencia en servicios construidos en diferentes idiomas. El backend evolucionó de tareas de fondo de FastAPI a una arquitectura assíncrona Celery + Redis para manejar análisis concurrentes y respetar límites de velocidad de Datadog y la puerta de IA interna.
STAR deliberadamente evita llamadas a funciones, RAG, uso de herramientas autónomas y memoria, en su lugar confiando en flujos de trabajo predefinidos para garantizar análisis consistentes y auditables que los ingenieros puedan validar rápidamente. La plataforma ha suportado investigaciones de incidentes de producción, análisis postmortem, solución de problemas de Kubernetes y diagnósticos de memoria JVM. Expedia está ampliando la plataforma para incorporar información de dependencia de servicios, integraciones basadas en MCP e interfaces conversacionales. La administración de avisos y eval utilizan Langfuse.
Para equipos SRE: STAR demuestra un enfoque pragmático entre la magia de prompt-a-Datadog y agentes de observabilidad totalmente autónomos. Al mantener flujos de trabajo determinísticos y supervisionados por humanos, Expedia evitó riesgos de alucinação mientras mantiene el razonamiento LLM en conjuntos de métricas complejos. El patrón assíncrono Celery + Redis vale la pena estudiar si su canal de respuesta a incidentes procesa múltiples análisis concurrentes. Buscar derivados de código abierto a medida que plataformas como New Relic y Datadog integren flujos de trabajo similares.