Sudeep Das, Head of New Verticals ML/AI da DoorDash, apresentou a arquitetura de recomendação por agentes em produção da empresa na QCon AI Boston em 1º de junho de 2026. Insight central: modelos de ranking de uma única passagem não se compõem em agentes. A DoorDash reconstruiu três camadas—representação de catálogo, memória do consumidor e classificação de intenção de consulta—antes de passar de previsão para planejamento.
A camada de catálogo usa IDs semânticos RQ-VAE: um autoencoder variacional quantizado residual que mapeia embeddings de produtos em tokens discretos em vez de IDs de item inteiros opacos. Com 100 milhões+ de SKUs em alimentos, mercearia, varejo e bebidas alcoólicas, isso habilita duas capacidades. Primeiro, RAG hierárquico torna-se viável—o sistema estreita a recuperação usando árvores de categoria antes que o LLM veja um prompt, mantendo inferência rápida e janelas de contexto compactas. Segundo, saídas de LLM mapeiam diretamente para identificadores de produto significativos, eliminando a etapa de resolução catálogo-para-previsão que consome latência e orçamento de tokens em RAG ingênuo.
Memória é a segunda camada, onde a DoorDash reportou ganhos de produção mais claros. O sistema de memória do agente mantém três níveis: memória de longo prazo do histórico comportamental offline (organizada em blocos versionados—Preferência Dietética, Padrões de Refeição, Marca do Item, Taxonomia de Item, Preferências de Loja, Padrões Entre Canais); contexto em sessão com sinais em tempo real e ponderação de recência; e memória conversacional de fatos declarados durante uma sessão. Sessões apoiadas por essa pilha converteram para checkouts de mercearia a uma taxa 24% superior e consultas de descoberta de restaurante 15% superior. Mal-entendido de intenção caiu 33% em avaliações com juiz LLM. Tamanhos de cesta aumentaram 17% e turnos conversacionais caíram 7% em uma execução de produção de sete dias.
O desafio de engenharia não é armazenar memória—é servi-la relevantemente. Recuperação ingênua top-K desperdiça contexto: "encontrar um lugar para jantar" requer tendências de culinária e histórico de preços; "Quero fazer chicken tikka masala" requer inventário de despensa e preferências de porção; "compre meus usuais" requer cadência de reabastecimento. A DoorDash resolveu isso com planejamento de consulta consciente de tarefa: o sistema de memória lê a tarefa atual antes da recuperação, executa busca híbrida (vetores semânticos mais filtros estruturados), classifica resultados, depois injeta no prompt. Sinais conversacionais extraem em blocos de memória duráveis de forma assíncrona.
A terceira camada aborda classificação de intenção de consulta. Marketplaces multi-categoria como o da DoorDash—Alimentos, Mercearia, Varejo, Bebidas Alcoólicas em uma única superfície—quebram classificadores softmax tradicionais. Aumentar confiança em "Restaurante" para "Wildflower" suprime "Varejo," mesmo quando ambas se aplicam. A DoorDash construiu um sistema Agentic Multi-Source Grounded: um LLM fundamentado em recuperação de entidade de catálogo em etapas, aumentado com busca na web por agente para consultas cold-start e cauda longa. Emite um conjunto multi-intenção ordenado com uma camada de desambiguação determinística aplicando políticas de negócios. Em produção, isso executa +10,9pp acima de um LLM não fundamentado e +4,6pp acima do sistema anterior híbrido BERT+LLM. Em consultas de cauda longa, fundamentação de catálogo contribui +8,3pp, busca na web por agente adiciona +3,2pp, e desambiguação dual-intenção adiciona +1,5pp, atingindo 90,7% de precisão. O sistema serve 95% das impressões de busca diárias via batch-and-cache offline—o LLM não está no caminho crítico.
Separação de plataforma previne colapso de complexidade. Equipes de domínio possuem agentes especializados (mercearia, restaurante, Dasher-assist); uma equipe de plataforma possui orquestração, ferramentas MCP, memória, infraestrutura de avaliação e componentes compartilhados. Interfaces de agente são idênticas entre verticais mas recebem regras de extração conscientes de vertical, fontes de recuperação e sinais de classificação. Ações determinísticas—aquelas que atualizam artefatos versionados—saltam o LLM inteiramente.
Recuperação de contexto consciente de tarefa, não escala de modelo, moveu conversão em toda a pilha de agentes da DoorDash.