Meta Engineering publicó el modelo de secuencia multi-etapa que impulsa su pila de ranking de anuncios en producción. La arquitectura muestra leyes de escalado estilo LLM entre etapas de canalización. Combinadas con mejoras del modelo GEM de Meta, estas innovaciones entregaron un aumento acumulado del 6% de conversión en Instagram, 3% en Facebook y 3,5% en clics de anuncios en Facebook. La cifra del 6% se basa en el lanzamiento Q2 de GEM, que por sí solo impulsó un aumento del 5% de conversión en Instagram y 3% en Facebook Feed.

El problema: los modelos de secuencia basados en transformadores lo suficientemente precisos como para importar son demasiado costosos para ejecutar en el momento de la entrega de anuncios. El enfoque híbrido anterior de Meta—un modelo para secuencias de eventos de usuario, otro para interacciones de características dispersas—introdujo transferencia de conocimiento con pérdida y alcanzó límites de escalado. Aumentar la longitud de secuencia o la profundidad del transformador agravó los compromisos.

La división de dos etapas desacopla el trabajo intensivo en cómputo de la ruta crítica de latencia. Un modelo de usuario sin conexión procesa historiales de usuario en varias capas de transformador con longitudes de secuencia en miles, luego almacena en caché incrustaciones por usuario independientes de cualquier candidato de anuncio específico. Un modelo de ranking en línea—optimizado para entrega con presupuesto de sub-latencia—ingiere esos incrustaciones en caché junto con señales en tiempo real frescos y candidatos de anuncios para producir rankings finales. Las incrustaciones de usuario no pueden ver características de anuncio o contexto, asegurando reutilización en todas las tareas de ranking sin recomputación.

La tokenización densa dobla características dispersas y datos de comportamiento secuencial en un vocabulario denso unificado, eliminando representaciones de características cruzadas diseñadas manualmente. La atención de múltiples cabezas consciente del objetivo funde esa secuencia de tokens densos con señales de candidatos de anuncios en cada capa. Cada bloque de atención pondera el comportamiento histórico del usuario contra el anuncio específico que se está puntuando. Las distribuciones de atención estables construyen representaciones de interacción de orden superior sin la desviación de distribución que obliga a compromisos de regularización.

La curva de escalado del modelo de secuencia no muestra signos de saturación—el desempeño sigue mejorando a medida que crece la capacidad del modelo sin conexión, sin aumento proporcional en los costos de entrega en línea. Meta ha logrado paridad arquitectónica con entrenamiento de LLM, lo que significa que técnicas como mixture-of-experts, intercambio de cómputo entre usuarios y variantes de atención avanzadas se pueden aplicar al modelo de usuario sin conexión con retornos predecibles. El modelo fundacional GEM es 4x más eficiente para impulsar ganancias de desempeño de anuncios por unidad de datos y cómputo que los modelos de ranking originales de Meta. Su pila de entrenamiento entrega un aumento de 23x en FLOPs de entrenamiento efectivos con utilización de FLOPS del modelo 1,43x usando 16x más GPUs.

Para arquitectos que diseñan canalizaciones de ranking multi-etapa, el aislamiento estricto de características ascendentes/descendentes es la opción estructural clave. Al garantizar que el modelo de usuario sin conexión nunca vea características de anuncio o contexto, Meta preserva la reutilización completa de incrustaciones en todas las tareas de ranking con sobrecarga de adaptación mínima. La tokenización densa reemplaza el cruzamiento de características manual—la ingeniería de interacción curada por humanos que históricamente consumió ancho de banda significativo del equipo en sistemas de recomendación. Eliminarlo elimina su límite de escalado.

Si su canalización de ranking acopla modelado de usuario a características de candidatos de anuncios en el momento de la entrega, tiene un límite que ninguna cantidad de hardware puede superar.