Netflix consolidó cinco modelos separados de ranking de artwork en uno codificando imágenes con embeddings CLIP, luego construyó dos sistemas adicionales de producción—ranking de artwork consciente de consultas y personalización de video previews—usando la misma infraestructura de embeddings. El cambio de representación de assets basada en ID a representación consciente del contenido resolvió el problema del cold-start para títulos nuevos y canvas mientras entregaba ganancias medibles en descubrimiento y horas de streaming.

El sistema de artwork funciona concatenando un embedding de imagen CLIP (768 dimensiones) con un embedding de ID aprendido, luego pasando ambos a través de una capa MLP para puntuar assets contra miembros. Porque los embeddings CLIP son en gran medida invariantes al crop y resize, el mismo artwork renderizado en cinco canvas diferentes—billboard, vertical-box, horizontal-panel, short-panel, landscape-panel—mapea a vectores casi idénticos. Esta invariancia permitió a Netflix reemplazar cinco modelos específicos de canvas con un único modelo unificado que agrupa señal de interacción en todos los canvas. Los modelos por-canvas habían tratado cada renderizado recortado como un ID de asset separado sin forma de transferir aprendizaje entre ellos; el modelo unificado aplica inmediatamente la afinidad de un miembro aprendida en canvas de alto tráfico a canvas escasos.

Entrenar el modelo unificado en canvas dispares introdujo un problema de mezcla de datos. Los conteos de impresiones crudos permitirían que el canvas de mayor volumen dominara, dejando canvas de bajo-datos sin ayuda. Netflix resolvió esto con ponderación basada en recompensa, donde cada ejemplo de entrenamiento se pondera por el score de recompensa a largo plazo de su tipo de interacción en lugar de por volumen de impresiones. Un canvas contribuye en proporción al valor a largo plazo de las interacciones que impulsa, no a cuántas veces fue mostrado. Este rebalanceo ocurrió automáticamente, sin hiperparámetros ajustados a mano por canvas.

La ablación probó tres variantes contra el sistema anterior de cinco modelos: embeddings de imagen solos en los modelos antiguos por-canvas, un modelo unificado con solo embeddings de ID, y ambos juntos. Offline, medido con inverse propensity scoring en tráfico de exploración, ambas ideas ayudaron en canvas con datos escasos pero ninguna movió significativamente la aguja por sí sola. Online, en un test A/B de cuatro semanas en todas las plataformas de dispositivos, solo el enfoque combinado—modelo unificado más embeddings de imagen—entregó lift estadísticamente significativo. Los efectos se compusieron: el lift de short-panel del enfoque combinado excedió V1 y V2 sumados, porque canvas maduros enseñaron al modelo compartido cómo los embeddings CLIP mapean a preferencia, y ese mapeo se transfirió directamente a canvas escasos. La prueba real vino cuando Netflix rediseñó su pantalla de inicio de TV para hacer short-panel el canvas dominante de la noche a la mañana. Netflix desplegó el modelo unificado antes del lanzamiento y retuvo un grupo de control en el sistema antiguo por-canvas durante un mes. El modelo unificado absorbió el cambio inmediatamente con ganancias estadísticamente significativas en métricas de descubrimiento y horas de streaming, mayores que la ablación de estado estable porque un cambio súbito de canvas es exactamente donde los embeddings conscientes del contenido ayudan más.

Ranking de artwork consciente de consultas, un sistema de producción separado, aprovecha los mismos embeddings CLIP sin modelado adicional. Porque CLIP proyecta texto e imágenes en un espacio de embedding compartido, Netflix mide qué tan bien una consulta de búsqueda coincide con un artwork candidato computando similitud coseno entre el embedding de texto CLIP de la consulta y el embedding de imagen CLIP del asset. Este término de alineación se mezcla con el score de personalización a través de un peso de mezcla ajustado vía A/B testing, permitiendo al ranker balancear "lo que creemos que te gusta" contra "lo que acabas de pedir".

Para video previews, Netflix construyó un tercer sistema distinto. SeqCLIP promedió embeddings CLIP de frames individuales, capturando cómo se veía un preview pero perdiendo movimiento, pacing, diálogo y soundtrack. MediaFM, el modelo de fundación multimodal interno de Netflix entrenado en 80 millones de shots, fusiona visual (vía SeqCLIP), audio (vía un encoder de speech y audio preentrenado) y texto (vía captions) en un embedding único por shot. En un test A/B online de cinco semanas, MediaFM superó SeqCLIP, que superó baselines solo-ID, con las mayores ganancias en TV. Las señales de audio y texto que los encoders solo-visuales no pueden capturar agregaron valor real.

Para evitar ejecutar trials end-to-end costosos para cada candidato de embedding nuevo, Netflix cierra el funnel con una sonda lineal entrenada en datos de exploración. Para un conjunto fijo de títulos, el sistema encuentra el ganador de popularidad desesgado—el asset con la tasa de interacción más alta después de ajustar por cuántas veces fue mostrado—y entrena un clasificador lineal para predecir ese ganador desde el embedding solo, sin título o metadata. Si el embedding captura los drivers semánticos de popularidad, la sonda supera adivinar al azar; si no, no lo hace. Las tres señales—precisión de sonda lineal, lift IPS offline y resultados A/B online—clasificaron MediaFM por delante de SeqCLIP, validando la tarea proxy como un paso de screening barato antes de evaluación completa.

El Embedding Store de Netflix desacopla actualizaciones de modelo de fundación de deployments de modelo de personalización. Un embedding nuevo se registra, se rellena en todo el catálogo y se valida independientemente, sin tocar código de entrenamiento o serving en modelos downstream. Los mismos embeddings se sirven en tiempo de entrenamiento y tiempo de inferencia online, eliminando skew. Esta infraestructura permitió a Netflix intercambiar CLIP en artwork, establecer ranking consciente de consultas en los mismos vectores y desplegar MediaFM a través de video previews como cambios independientes en lugar de migraciones coordinadas. Para equipos construyendo sistemas de recomendación con componentes de visión y lenguaje, la lección es que los embeddings conscientes del contenido resuelven cold-start no reuniendo más datos sino transfiriendo preferencias aprendidas en assets que comparten propiedades semánticas, y que las señales multimodales componen sus beneficios cuando se unifican en un espacio de embedding compartido.