Pesquisadores da NVIDIA publicaram um guia completo de adaptação para executar a pilha de recuperação Nemotron em grego moderno, cobrindo cada camada desde a mineração de corpus até um leitor de mistura de especialistas ajustado com LoRA. O artigo, submetido em 5 de agosto de 2026, é direcionado para RAG em setores de leis, energia, finanças e medicina—quatro setores regulados onde o grego é a linguagem operacional e onde não existia nenhum benchmark de recuperação em nível de produção.

A descoberta central desafia um atalho comum: a recuperação de baseline BM25 supera vários recuperadores densos multilíngues prontos para uso em corpora especializados em grego antes de qualquer ajuste fino. No HERA—um novo benchmark de domínio especializado cobrindo texto grego especializado em leis, energia, finanças e medicina—o embedder Nemotron 1B não adaptado obtém nDCG@10 de 0.362. Após ajuste fino em 65.773 pares de recuperação grego sinteticamente gerados, ele atinge 0.835—um ganho de 2.3× sobre BM25. Esse baseline de 0.362 é específico para queries de domínio especializado do HERA. Uma avaliação separada no catálogo de livros gregos CUP (arxiv 2607.21274) mostra o mesmo modelo Nemotron pronto para uso alcançando nDCG@9 de 0.582 em texto acadêmico geral—um dataset, métrica e conjunto de resultados diferentes não diretamente comparáveis ao HERA. As representações aprendidas transferem para grego de domínio geral, embora a vantagem do BM25 permaneça dependente de domínio fora da distribuição de treinamento.

O pipeline de treinamento é totalmente automatizado. A mineração de corpus reúne texto grego específico de domínio. Uma fase de supervisão sintética gera pares query–passage sem anotação manual. O bi-encoder Nemotron 1B é ajustado em 65.773 pares. Um reranker cross-encoder é adaptado separadamente e entrega melhorias nDCG consistentes em todos os domínios especializados. A pilha completa—embedder, reranker, leitor—mapeia diretamente para receitas de recuperação NeMo existentes da NVIDIA, que incluem scripts de ajuste fino e caminhos de destilação para os modelos Nemotron Embed 1B e 8B.

Na camada de leitor, o time ajusta com LoRA um modelo Nemotron 30B-A3B MoE. A correção de resposta avaliada sobe de 29.4% para 66.9%, com ganhos simultâneos em fidelidade e qualidade de citação. A arquitetura 30B-A3B carrega 31.6 bilhões de parâmetros totais mas ativa 3.2 bilhões por passagem para frente (3.6B incluindo embeddings), conforme o relatório técnico Nemotron 3 Nano. O custo de inferência se aproxima mais de um modelo denso 3B do que um 30B—a figura que importa para estimativas de produção.

HERA, lançado junto com o artigo, é a primeira avaliação RAG em larga escala para grego cobrindo domínios de leis, energia e finanças. Ele fornece equipes um alvo de avaliação concreto em vez de benchmarks em inglês traduzidos, que misrepresentam terminologia específica do grego, gramática e vocabulário de domínio. Ambos os modelos adaptados e o benchmark são públicos.

Cada componente—geração de pares sintéticos, ajuste fino de bi-encoder, adaptação de reranker cross-encoder, ajuste LoRA MoE—é agnóstico quanto à linguagem. Equipes construindo RAG para outras linguagens subutilizadas podem replicar este pipeline. A coleta de corpus específica de domínio é o gargalo primário. A qualidade da supervisão sintética determina resultados: os 65.773 pares necessários para mover nDCG@10 de 0.362 para 0.835 exigiram geração deliberada de query, não amostragem aleatória.

Se seu domínio de recuperação é estreito e sua linguagem fica fora das 10 principais linguagens MTEB, trate BM25 como seu baseline real—não um modelo de embedding multilíngue. Orçamento para pelo menos 50.000 pares de recuperação sintética antes de esperar que a recuperação densa entregue resultados.