Netflix consolidou cinco modelos separados de ranking de capas em um ao codificar imagens com embeddings CLIP, depois construiu dois sistemas adicionais de produção—ranking de capas ciente de consultas e personalização de prévia de vídeo—usando a mesma infraestrutura de embeddings. A mudança de representação de ativos baseada em ID para ciente de conteúdo resolveu o problema de cold-start para títulos e canvases novos enquanto entregava ganhos mensuráveis em descoberta e horas de streaming.

O sistema de capas funciona concatenando um embedding de imagem CLIP (768 dimensões) com um embedding de ID aprendido, depois passando ambos por uma camada MLP para pontuar ativos contra membros. Como embeddings CLIP são largamente invariantes a corte e redimensionamento, a mesma capa renderizada em cinco canvases diferentes—billboard, vertical-box, horizontal-panel, short-panel, landscape-panel—mapeia para vetores quase idênticos. Essa invariância deixou Netflix substituir cinco modelos específicos de canvas por um único modelo unificado que agrupa sinal de interação em todos os canvases. Os modelos por-canvas tratavam cada renderização cortada como um ID de ativo separado sem forma de transferir aprendizado entre eles; o modelo unificado aplica imediatamente a afinidade de um membro aprendida em canvases de alto tráfego para os esparsos.

Treinar o modelo unificado em canvases díspares introduziu um problema de mistura de dados. Contagens brutas de impressões deixariam o canvas de maior volume dominar, deixando canvases de baixo volume sem ajuda. Netflix resolveu isso com ponderação baseada em recompensa, onde cada exemplo de treinamento é ponderado pelo score de recompensa de longo prazo de seu tipo de interação em vez de por volume de impressões. Um canvas contribui em proporção ao valor de longo prazo das interações que impulsiona, não a quantas vezes foi mostrado. Esse rebalanceamento aconteceu automaticamente, sem hiperparâmetros ajustados manualmente por canvas.

A ablação testou três variantes contra o sistema anterior de cinco modelos: embeddings de imagem sozinhos nos modelos antigos por-canvas, um modelo unificado com apenas embeddings de ID, e ambos juntos. Offline, medido com inverse propensity scoring em tráfego de exploração, ambas as ideias ajudaram em canvases com falta de dados mas nenhuma moveu a agulha significativamente sozinha. Online, em um teste A/B de quatro semanas em todas as plataformas de dispositivo, apenas a abordagem combinada—modelo unificado mais embeddings de imagem—entregou lift estatisticamente significativo. Os efeitos se compuseram: o lift de short-panel da abordagem combinada excedeu V1 e V2 somados, porque canvases maduros ensinaram ao modelo compartilhado como embeddings CLIP mapeiam para preferência, e esse mapeamento transferiu diretamente para canvases esparsos. O teste real veio quando Netflix redesenhou sua tela inicial de TV para fazer short-panel o canvas dominante da noite para o dia. Netflix implantou o modelo unificado antes do lançamento e reteve um grupo de controle no sistema antigo por-canvas por um mês. O modelo unificado absorveu a mudança imediatamente com ganhos estatisticamente significativos em métricas de descoberta e horas de streaming, maiores que a ablação de estado estacionário porque uma mudança súbita de canvas é exatamente onde embeddings cientes de conteúdo ajudam mais.

Ranking de capas ciente de consultas, um sistema de produção separado, aproveita os mesmos embeddings CLIP sem modelagem adicional. Como CLIP projeta texto e imagens em um espaço de embedding compartilhado, Netflix mede o quão bem uma consulta de busca corresponde a uma capa candidata computando similaridade de cosseno entre o embedding de texto CLIP da consulta e o embedding de imagem CLIP do ativo. Esse termo de alinhamento é misturado com o score de personalização através de um peso de mistura ajustado via teste A/B, deixando o ranker balancear "o que achamos que você gosta" contra "o que você acabou de pedir".

Para prévia de vídeos, Netflix construiu um terceiro sistema distinto. SeqCLIP fez média de embeddings CLIP de frames individuais, capturando como uma prévia parecia mas perdendo movimento, ritmo, diálogo e trilha sonora. MediaFM, o modelo de fundação multimodal interno de Netflix treinado em 80 milhões de shots, funde visual (via SeqCLIP), áudio (via um codificador de fala e áudio pré-treinado) e texto (via legendas) em um único embedding por shot. Em um teste online de cinco semanas, MediaFM superou SeqCLIP, que superou baselines apenas de ID, com os maiores ganhos em TV. Os sinais de áudio e texto que codificadores apenas visuais não conseguem capturar adicionaram valor real.

Para evitar rodar testes caros de ponta a ponta para cada candidato de embedding novo, Netflix abre o funil com uma sonda linear treinada em dados de exploração. Para um conjunto fixo de títulos, o sistema encontra o vencedor de popularidade desviado—o ativo com a maior taxa de interação depois de ajustar por quantas vezes foi mostrado—e treina um classificador linear para prever esse vencedor do embedding sozinho, sem título ou metadados. Se o embedding captura os drivers semânticos de popularidade, a sonda bate adivinhação aleatória; se não, não bate. Todos os três sinais—acurácia de sonda linear, lift IPS offline e resultados A/B online—classificaram MediaFM à frente de SeqCLIP, validando a tarefa proxy como um passo de triagem barato antes de avaliação completa.

O Embedding Store de Netflix desacopla atualizações de modelo de fundação de deployments de modelo de personalização. Um embedding novo é registrado, preenchido retroativamente em todo o catálogo e validado independentemente, sem tocar em código de treinamento ou serving em modelos downstream. Os mesmos embeddings são servidos em tempo de treinamento e tempo de inferência online, eliminando skew. Essa infraestrutura deixou Netflix trocar CLIP em capas, montar ranking ciente de consultas nos mesmos vetores e lançar MediaFM através de prévia de vídeos como mudanças independentes em vez de migrações coordenadas. Para times construindo sistemas de recomendação com componentes de visão e linguagem, a lição é que embeddings cientes de conteúdo resolvem cold-start não ao reunir mais dados mas ao transferir preferências aprendidas em ativos que compartilham propriedades semânticas, e que sinais multimodais compõem seus benefícios quando unificados em um espaço de embedding compartilhado.