Plataforma STAR da Expedia usa LLMs para análise de causa raíz de incidentes; fluxos de trabalho determinísticos reduzem tempo médio de recuperação
Expedia Group implantou Service Telemetry Analyzer (STAR), uma plataforma interna de observabilidade assistida por IA projetada para acelerar a investigação de incidentes de produção. Em vez de agentes autônomos, STAR usa fluxos de trabalho determinísticos combinando métricas do Datadog com análise orientada por LLM: telemetria é coletada, analisada via prompts específicos de domínio, consolidada em descobertas intermediárias e resumida em um relatório final com causa raízes e próximas etapas. O objetivo: reduzir tempo-para-conhecer (TTK) e tempo-para-recuperar (TTR) enquanto mantendo humanos responsáveis pela validação e tomada de decisão.
STAR é construido como uma aplicação FastAPI integrando Datadog para métricas de serviço e o gateway de IA generativa interno da Expedia gerenciando acesso LLM. O sistema analisa métricas de infraestrutura em serviços baseados em Kubernetes e aplicações JVM: throughput de solicitação, latência, taxas de erro (HTTP/gRPC/GraphQL), utilização de CPU/memória, reinic ios de continer, falhas de sonda, estado de heap Java e coleta de lixo. Expedia usa telemetria de infraestrutura padronizada para manter consistência em serviços construídos em diferentes linguagens. O backend evoluiu de tarefas de fundo do FastAPI para uma arquitetura assíncrona Celery + Redis para lidar com análises concorrentes e respeitar limites de taxa do Datadog e do gateway de IA interno.
STAR deliberadamente evita chamadas de função, RAG, uso de ferramenta autônoma e memória—confiando em fluxos de trabalho predefinidos para garantir análises consistentes e auditable que os engenheiros podem validar rapidamente. A plataforma suportou investigações de incidentes de produção, análise de pós-mortem, resolução de problemas de Kubernetes e diagnósticos de memória JVM. Expedia está expandindo a plataforma para incorporar informações de dependência de serviço, integrações baseadas em MCP e interfaces conversacionais. Gerenciamento de prompts e eval usam Langfuse.
Para equipes SRE: STAR demonstra um meio termo pragmático entre magia de prompt-para-Datadog e agentes de observabilidade totalmente autônomos. Ao manter fluxos de trabalho determinísticos e supervisionados por humanos, Expedia evitou riscos de alucinação enquanto mantinha raciocínio LLM em conjuntos de métricas complexas. O padrão assíncrono Celery + Redis vale a pena estudar se seu pipeline de resposta a incidentes processa múltiplas análises concorrentes. Assista por derivadas de código aberto conforme plataformas como New Relic e Datadog integram fluxos de trabalho semelhantes.