Netflix GenRec: rankedor de recomendação nativo de LLM corresponde aos sistemas de produção com menos recursos, usa treinamento ponderado por recompensa
Pesquisadores da Netflix publicaram GenRec, um rankedor de recomendação apoiado por LLM que pós-treina um LLM de fundação interno em dados e objetivos comerciais específicos da Netflix. GenRec verbaliza históricos de usuário, metadados de itens e contexto como texto, depois pós-treina um LLM de fundação adaptado à Netflix para classificação com um cabeça de pontuação ciente do catálogo. Em um teste A/B em larga escala contra o rankedor de produção bem ajustado da Netflix, GenRec alcançou melhorias estatisticamente significativas no engajamento de curto prazo e retenção de membro de longo prazo, enquanto usava apenas uma pequena fração dos dados rotulados e sinais de entrada necessários pelo sistema tradicional.
GenRec segue um framework de treinamento de duas fases. A fase 1 adapta um LLM de código aberto em corpora proprietários da Netflix para desenvolver compreensão de conteúdo da Netflix, padrões de comportamento de membro e capacidades gerais de linguagem. A fase 2 pós-treina para dados e objetivos específicos de classificação usando múltiplos sinais de recompensa alinhados ao valor do membro de longo prazo (satisfação, retenção, não apenas cliques de curto prazo). O treinamento converte centenas de bilhões de eventos de interação em turnos conversacionais onde a mensagem do usuário codifica contexto verbalizado, perfil, histório e metadados de item, e a mensagem do assistente representa engajamento real do membro (títulos reproduzidos, duração, feedback). O modelo aprende como o engajamento depende do contexto sem decodificar respostas no tempo de inferência.
A arquitetura funciona em modo de preenchimento apenas na pilha de atendimento de LLM da Netflix para eficiência de custo, eliminando geração de token cara. Ao confiar em verbalização e engenharia de contexto em vez de recursos feitos manualmente, GenRec muda o ônus da engenharia de engenharia de recursos densa para representação de texto interpretável. A abordagem reduz alucinações de catálogo e erros fora de distribuição comuns em LLMs prontos para uso, enquanto preserva a compreensão semântica que torna os LLMs poderosos para recomendação.
Contexto: O recommender de produção tradicional da Netflix empilha milhares de recursos feitos manualmente sobre usuários, itens e interações com arquiteturas especializadas para modelagem de seqüência e objetivos multi-tarefa. Isso tem sido custoso e lento para estender a novos tipos de conteúdo (jogos, live, podcasts) ou superfícies de produtos. Classificação baseada em LLM contorna grande parte dessa complexidade tratando a recomendação como um problema de modelagem de linguagem sobre histório verbalizado e metadados.
Para profissionais, a implicação é estrutural: sistemas de recomendação baseados em classificação nativa de LLM podem competir com sistemas de recursos densos enquanto exigem menos exemplos rotulados e são mais simples de adaptar a novos tipos de conteúdo. A dependência de treinamento ponderado por recompensa para alinhar com métricas de negócio de longo prazo mostra como orientar LLMs para objetivos comerciais em vez de modelagem de linguagem genérica, um padrão que provavelmente se repete em domínios de recomendação, classificação e personalização.
Fontes
- Primary source
- netflixtechblog.com
“GenRec achieves statistically significant improvements in both short-term and long-term online metrics, while using only a small fraction of the labeled data and input signals”
- netflixtechblog.com
“GenRec follows a two-phase training framework...Phase 1 trains a foundational LLM on Netflix data...Phase 2 post-trains on ranking-specific data and objectives”
- netflixtechblog.com
“It reduces our reliance on hand-engineered features and shifts the focus from feature engineering to context engineering”