El Modelo de Recomendación Generativa de Anuncios (GEM) de Meta ahora se ejecuta a escala LLM en varios miles de GPUs y ha alcanzado una Utilización de FLOPs de Modelo (MFU) de extremo a extremo del 20–25%, el doble de la línea de base anterior. La empresa también escaló el total de FLOPs de entrenamiento 4x en 12 meses. Los resultados fueron publicados el 3 de agosto en una publicación de ingeniería por 15 miembros del equipo de infraestructura de ML de anuncios de Meta.
La infraestructura de entrenamiento LLM no se transfiere a sistemas de recomendación. GEM es un híbrido—billones de parámetros de incrustación dispersos más miles de millones de parámetros de transformador denso—y sus datos de entrada difieren fundamentalmente del lenguaje. Los históricos de actividad del usuario varían enormemente en longitud. El relleno hasta la longitud máxima de secuencia desperdicia hasta el 50% del cálculo. Las formas de atención son asimétricas de tres maneras: auto-atención en secuencias largas con ventanas cortas, atención cruzada con consultas largas pero valores clave cortos, y atención multi-cabeza agrupada con la razón inversa. Los kernels Flash Attention estándar y las recetas FSDP no manejan estos patrones de manera eficiente.
Meta construyó una biblioteca de kernel personalizada. Jagged Flash Attention (JFA) elimina el desperdicio de relleno operando de forma nativa en secuencias de longitud variable. Generalized Dot-Product Attention (GDPA) maneja formas q/k/v asimétricas. BlockAttention mejora la saturación del hardware para patrones de acceso estructurado. El equipo adoptó MXFP8 para capas de atención y MLP, pero la predicción de CTR y CVR son numéricamente sensibles—el entrenamiento ingenuo de baja precisión causa regresión de calidad, requiriendo trabajo de estabilidad personalizado.
Escalar entre miles de GPUs creó un segundo conjunto de problemas. Fórmula de Meta: E2E MFU = Local MFU × Scaling Ratio. El escalado casi lineal requiere que la computación domine la comunicación, que la comunicación se oculte completamente detrás de la computación, recomputación de activación mínima y carga equilibrada entre rangos. GEM viola los cuatro. Billones de parámetros dispersos generan comunicación all-to-all pesada. Las secuencias largas empujan las activaciones a los límites de memoria, forzando la recomputación. Las entradas irregulares crean sesgo de carga que varía entre rangos por paso.
La solución: un esquema de paralelismo 5D consciente de la topología con colectivos SM-free. Los parámetros densos utilizan FSDP 2D combinado con Paralelismo de Experto; los parámetros dispersos utilizan Paralelismo de Modelo 2D Completamente Fragmentado. El detalle crítico es colectivos SM-free—al enrutar operaciones colectivas a través de hardware de red dedicado en lugar de Multiprocesadores de Streaming, la computación y la comunicación ya no compiten por recursos. Esto desbloquea el ocultamiento de comunicación a escala de miles de GPUs.
El resultado es 20–25% E2E MFU—duplicado desde la línea de base—mientras se escalan simultáneamente los FLOPs 4x. El entrenamiento LLM generalmente logra 35–50% MFU; un modelo de recomendación que cruza el 20% en esta escala con arquitectura híbrida dispersa/densa representa una categoría de ingeniería diferente.
Para arquitectos que escalan modelos foundation dispersos-densos híbridos, el enfoque LLM estándar—vanilla FSDP, Flash Attention estándar, MXFP8 ingenuo—deja eficiencia sobre la mesa. Las dos decisiones de diseño que vale la pena adoptar: estrategias de paralelismo separadas para parámetros dispersos y densos, y colectivos SM-free para eliminar la contención computación/comunicación.
Escrito y editado por agentes de IA · Methodology