Netflix GenRec: rankedor de recomendación nativo de LLM coincide con sistemas de producción con menos características, usa entrenamiento ponderado por recompensa
Los investigadores de Netflix publicaron GenRec, un rankedor de recomendación respaldado por LLM que post-entrena un LLM de fundación interno en datos y objetivos comerciales específicos de Netflix. GenRec verbaliza historiales de usuarios, metadatos de elementos y contexto como texto, luego post-entrena un LLM de fundación adaptado a Netflix para la clasificación con una cabeza de puntuación consciente del catálogo. En una prueba A/B a gran escala contra el rankedor de producción bien ajustado de Netflix, GenRec logró mejoras estadisticamente significativas en el compromiso a corto plazo y la retención de miembros a largo plazo, mientras usaba solo una pequeña fracción de los datos etiquetados y señales de entrada requeridas por el sistema tradicional.
GenRec sigue un marco de entrenamiento de dos fases. La fase 1 adapta un LLM de código abierto en corpora propietarios de Netflix para desarrollar compresión de contenido de Netflix, patrones de comportamiento de miembros y capacidades de lenguaje general. La fase 2 post-entrenam datos y objetivos específicos de clasificación utilizando múltiples señales de recompensa alineadas con el valor de miembro a largo plazo (satisfacción, retención, no solo clics a corto plazo). El entrenamiento convierte cientos de miles de millones de eventos de interacción en turnos conversacionales donde el mensaje del usuario codifica contexto verbalizado, perfil, historial y metadatos de elementos, y el mensaje del asistente representa el compromiso real del miembro (títulos reproducidos, duración, comentarios). El modelo aprende cómo el compromiso depende del contexto sin decodificar respuestas en el momento de la inferencia.
La arquitectura se ejecuta en modo de prefill-solo en la pila de servicio de LLM de Netflix para la eficiencia de costos, eliminando la generación de tokens cara. Al confiar en verbalidad e ingeniería de contexto en lugar de características hechas manualmente, GenRec cambia la carga de ingeniería de la ingeniería de características densas a la representación de texto interpretable. El enfoque reduce las alucinaciones de catálogo y los errores fuera de distribución comunes en los LLM de uso inmediato, mientras preserva la comprensión semántica que hace que los LLM sean poderosos para la recomendación.
Contexto: El recommender de producción tradicional de Netflix apila miles de características hechas manualmente sobre usuarios, elementos e interacciones con arquitecturas especializadas para modelado de secuencias y objetivos multitarea. Esto ha sido costoso y lento para extender a nuevos tipos de contenido (juegos, en vivo, podcasts) o superficies de productos. La clasificación respaldada por LLM evita gran parte de esa complejidad al tratar la recomendación como un problema de modelado de lenguaje sobre historial verbalizado y metadatos.
Para los profesionales, la implicación es estructural: los sistemas de recomendación basados en clasificación nativa de LLM pueden competir con sistemas de características densas mientras requieren menos ejemplos etiquetados y son más simples de adaptar a nuevos tipos de contenido. La dependencia del entrenamiento ponderado por recompensa para alinearse con métricas comerciales a largo plazo muestra cómo orientar LLM hacia objetivos comerciales en lugar de modelado de lenguaje genérico, un patrón que probablemente se repita en dominios de recomendación, clasificación y personalización.
Fuentes
- Primary source
- netflixtechblog.com
“GenRec achieves statistically significant improvements in both short-term and long-term online metrics, while using only a small fraction of the labeled data and input signals”
- netflixtechblog.com
“GenRec follows a two-phase training framework...Phase 1 trains a foundational LLM on Netflix data...Phase 2 post-trains on ranking-specific data and objectives”
- netflixtechblog.com
“It reduces our reliance on hand-engineered features and shifts the focus from feature engineering to context engineering”