DoorDash ha lanzado SafeChat, un sistema de moderación de contenido multi-modelo síncrono que examina cada mensaje de chat, imagen y llamada de voz antes de la entrega. La plataforma procesa 4 millones de mensajes de chat, 400.000 llamadas de voz y 200.000 imágenes diariamente. La restricción es severa: un mensaje no puede entregarse hasta que se clasifique como seguro, requiriendo que la conclusión del pipeline ocurra en una fracción de segundo en lugar de los 2–10 segundos que requiere una llamada raw LLM.
La arquitectura descansa en una observación fundamental: solo porcentajes de un dígito de mensajes son inseguros. Esa distribución moldea cada decisión de costo y latencia descendente.
La Fase 1 desplegó una cascada de tres capas. Una API de moderación gratuita con umbral muy bajo limpió automáticamente el 90% de los mensajes. El tráfico restante se movió a un LLM rápido y de bajo costo con mayor precisión, llevando el 99,8% de ese al estado seguro. El 0,2% restante fue a un LLM preciso y de mayor costo que puntuó mensajes de 0–5 en tres categorías: profanidad, amenazas y contenido sexual. Los mensajes que puntuaron 4 o superior en al menos dos categorías activaron acciones protectoras de Dasher, incluyendo cancelación de entrega.
La Fase 1 acumuló 10 millones de puntos de datos etiquetados. DoorDash entrenó un clasificador interno en ese corpus—sin costo por llamada, desplegado en su propia infraestructura. La Fase 2 reemplazó las dos primeras capas externas con este modelo. Produce safeScore y unsafeScore que suman 1. Un safeScore alto limpia inmediatamente; un unsafeScore alto se enruta al LLM preciso. El modelo interno ahora maneja el 99,8% del tráfico de chat en menos de 300 milisegundos. El LLM preciso costoso recibe menos del 0,2% de los mensajes; los mensajes marcados pueden tomar hasta 3 segundos, agregando latencia solo donde un mensaje es probablemente inseguro.
La moderación de imágenes siguió un camino diferente. DoorDash probó en shadow una API externa de visión por computadora durante dos semanas antes de que la producción la rechazara: tasa de falso positivo demasiado alta. El equipo evaluó modelos de CV adicionales y ajustó umbrales a través de revisión humana iterativa. El pipeline de producción ahora maneja más de 200.000 imágenes diariamente con latencia compatible con interacciones en vivo.
La moderación de voz es la más nueva y más difícil. A diferencia del chat, la voz no puede bloquearse antes de que se pronuncien las palabras. El pipeline transmite llamadas en tiempo real, analizando tono, palabras transcritas y contexto conversacional en múltiples idiomas. DoorDash lanzó la moderación de voz primero en modo solo observación—la aplicación automática no se activó hasta que los umbrales de confianza se validaron contra datos observados. Las acciones disponibles incluyen terminación de llamada y restricciones de comunicación; las violaciones severas o repetidas escalan a agentes de seguridad humanos y disparan suspensión de cuenta.
La aplicación se gradúa por severidad y recurrencia en todos los canales. El equipo construyó flujos de trabajo de configuración sin código y un harness de backtesting para que los cambios de política se validen contra tráfico histórico antes de hacerse efectivos. Esto importa para organizaciones que necesitan que no-ingenieros sean propietarios de política de moderación sin tocar código de modelo.
SafeChat ha reducido incidentes de seguridad de severidad baja y media en 50% desde su implementación.
Para arquitectos que construyen cualquier pipeline de decisión de IA en tiempo real: mida primero la distribución real, luego construya una puerta barata agresiva para la mayoría fácil. Use tráfego de producción para etiquetar datos para un modelo interno sin costo. Reserve el modelo frontier costoso para casos duros irreducibles. Esta matemática de cascata reduce llamadas de inferencia costosas en 99,8% sin compromiso para recall.