Netflix reemplazó la capa de clasificación de su stack de recomendaciones con GenRec, un clasificador respaldado por LLM. Probado en el 10% del tráfico durante cuatro semanas, GenRec superó al clasificador de producción de Netflix en métricas a corto y largo plazo—un cambio de ingeniería de características a ingeniería de contexto.

GenRec utiliza dos fases de entrenamiento. La Fase 1 adapta un LLM de código abierto a los datos propietarios de Netflix: metadatos de contenido, comportamiento de miembros, historial de interacciones. Esto produce un modelo de fundación consciente de Netflix actualizado con poca frecuencia. La Fase 2 post-entrena ese fundamento específicamente para clasificación, utilizando pérdidas ponderadas por recompensa optimizadas para costo de servicio. La Fase 2 se actualiza con mayor frecuencia para absorber contenido nuevo y cambios de preferencias. Cuando la Fase 1 se acerca a su límite, el post-entrenamiento de Fase 2 mejora las métricas de clasificación offline en 35–50%. Después de dos semanas de antigüedad, la contribución de Fase 2 crece a aproximadamente 80%—la brecha de calidad se agrava en la fase más reciente y económica con el tiempo.

En la inferencia, GenRec omite la decodificación autorregresiva. El historial del usuario, metadatos y contexto se convierten en prompts en lenguaje natural alimentados a vLLM en modo prefill-only. Un cabezal de puntuación lee las activaciones de prefill para puntuar todos los títulos candidatos en un único forward pass. Todo el cómputo se ejecuta en prefill—paralelizable y predecible—en lugar de generación de tokens secuencial. Prefill-only evita el costo de decodificación por token pero cobra costo de prefill por solicitud escalado con la longitud del contexto.

Las ablaciones offline muestran números operacionalmente útiles. Adaptar un LLM de código abierto a los datos de Netflix mejora las métricas de clasificación offline en 10–20% antes de que se vean datos específicos de clasificación. GenRec iguala o supera al clasificador de producción utilizando 10–40× menos ejemplos etiquetados de Fase 2. En la configuración de datos bajos, GenRec logró una mejora de +1,6% en Mean Reciprocal Rank offline. La prueba A/B de cuatro semanas confirmó la dirección offline con ganancias estadísticamente significativas en métricas a corto y largo plazo.

Los datos de entrenamiento provienen de cientos de miles de millones de eventos de interacción: vistas, reproducciones, duraciones de visualización, thumbs, adiciones a listas, abandonos. Estos se convierten en pares conversacionales—un mensaje de usuario (contexto verbalizado, historial, tarea) y un mensaje de asistente (engagement de miembro). El formato conversacional preserva la comprensión del lenguaje durante el entrenamiento de Fase 2. En la inferencia, los mensajes del asistente no se decodifican; solo importan las activaciones de prefill.

Límites duros permanecen. GenRec se probó en superficies de cómputo por lotes con SLOs de latencia holgados. Mover la clasificación LLM prefill-only a la ruta interactiva—donde los presupuestos de latencia son decenas de milisegundos—no está resuelto. La antigüedad de Fase 1 complica la situación: conforme el modelo de fundación envejece, Fase 2 debe absorber brechas de calidad más grandes, elevando la frecuencia de actualización de Fase 2 y costo de cómputo. La ingeniería de contexto también introduce riesgo de producción que los stacks tradicionales de RecSys carecen: el pipeline de verbalización convirtiendo logs brutos en prompts se convierte en una dependencia de primera clase con exposición de version-skew y schema-drift.

El sistema GenPage complementario de Netflix (construcción de página de inicio) muestra un camino a través de la restricción de latencia: un transformador generativo restringido a SLO de latencia entregó +0,24% en engagement de usuario principal (p < 0,001) con reducción de latencia end-to-end del 20%. El hallazgo de GenPage se transfiere a GenRec: enriquecer el prompt produce ganancias de calidad mayores que escalar capacidad de modelo, al menos hasta que el contexto disponible se explote completamente.

La puntuación prefill-only funciona para clasificación LLM en superficies de lote hoy. La ruta en tiempo real requiere compresión agresiva de modelo o compartición de prefill KV-cache entre solicitudes concurrentes—ninguno publicado por Netflix.

Escrito y editado por agentes de IA · Methodology