Sudeep Das, Head of New Verticals ML/AI de DoorDash, presentó la arquitectura de recomendación por agentes en producción de la empresa en QCon AI Boston el 1 de junio de 2026. Insight central: los modelos de ranking de una sola pasada no se componen en agentes. DoorDash reconstruyó tres capas—representación de catálogo, memoria del consumidor y clasificación de intención de consulta—antes de pasar de predicción a planificación.
La capa de catálogo utiliza IDs semánticos RQ-VAE: un autocodificador variacional cuantizado residual que mapea incrustaciones de productos en tokens discretos en lugar de IDs de artículos enteros opacos. Con 100 millones+ de SKU en alimentos, abarrotes, retail y bebidas alcohólicas, esto habilita dos capacidades. Primero, RAG jerárquico se vuelve viable—el sistema estrecha la recuperación usando árboles de categoría antes de que el LLM vea un prompt, manteniendo inferencia rápida y ventanas de contexto compactas. Segundo, las salidas de LLM se mapean directamente a identificadores de producto significativos, eliminando el paso de resolución catálogo-a-predicción que consume latencia y presupuesto de tokens en RAG ingenuo.
Memoria es la segunda capa, donde DoorDash reportó ganancias de producción más claras. El sistema de memoria del agente mantiene tres niveles: memoria a largo plazo del historial de comportamiento offline (organizada en bloques versionados—Preferencia Dietética, Patrones de Comidas, Marca del Artículo, Taxonomía de Artículo, Preferencias de Tienda, Patrones Entre Canales); contexto en sesión con señales en tiempo real y ponderación de recencia; y memoria conversacional de hechos declarados durante una sesión. Las sesiones respaldadas por esta pila se convirtieron a checkouts de abarrotes a una tasa 24% superior y consultas de descubrimiento de restaurante 15% superior. La confusión de intención cayó 33% en evaluaciones con juez LLM. Los tamaños de cesta aumentaron 17% y los turnos conversacionales cayeron 7% en una ejecución de producción de siete días.
El desafío de ingeniería no es almacenar memoria—es servirla de manera relevante. La recuperación top-K ingenua desperdicia contexto: "encontrar un lugar para cenar" requiere tendencias de cocina e historial de precios; "Quiero hacer chicken tikka masala" requiere inventario de despensa y preferencias de porción; "comprar mis habituales" requiere cadencia de reabastecimiento. DoorDash resolvió esto con planificación de consulta consciente de tareas: el sistema de memoria lee la tarea actual antes de la recuperación, ejecuta búsqueda híbrida (vectores semánticos más filtros estructurados), clasifica resultados, luego inyecta en el prompt. Las señales conversacionales se extraen en bloques de memoria duraderos de forma asincrónica.
La tercera capa aborda la clasificación de intención de consulta. Los mercados multi-categoría como el de DoorDash—Alimentos, Abarrotes, Retail, Bebidas Alcohólicas en una sola superficie—rompen los clasificadores softmax tradicionales. Aumentar la confianza en "Restaurante" para "Wildflower" suprime "Retail," incluso cuando ambas se aplican. DoorDash construyó un sistema Agentic Multi-Source Grounded: un LLM fundamentado en recuperación de entidad de catálogo por etapas, aumentado con búsqueda web por agente para consultas cold-start y cola larga. Emite un conjunto multi-intención ordenado con una capa de desambiguación determinística aplicando políticas de negocio. En producción, esto se ejecuta +10,9pp por encima de un LLM no fundamentado y +4,6pp por encima del sistema anterior BERT+LLM híbrido. En consultas de cola larga, el anclaje de catálogo contribuye +8,3pp, la búsqueda web por agente suma +3,2pp, y la desambiguación de intención dual suma +1,5pp, alcanzando 90,7% de precisión. El sistema sirve 95% de las impresiones de búsqueda diarias a través de batch-and-cache offline—el LLM no está en la ruta crítica.
La separación de plataforma previene el colapso de complejidad. Los equipos de dominio poseen agentes especializados (abarrotes, restaurante, Dasher-assist); un equipo de plataforma posee orquestación, herramientas MCP, memoria, infraestructura de evaluación y componentes compartidos. Las interfaces de agentes son idénticas entre verticales pero reciben reglas de extracción conscientes de vertical, fuentes de recuperación y señales de clasificación. Las acciones determinísticas—aquellas que actualizan artefactos versionados—omiten el LLM completamente.
La recuperación de contexto consciente de tareas, no la escala de modelo, movió la conversión en toda la pila de agentes de DoorDash.