Los investigadores de NVIDIA publicaron una guía completa de adaptación para ejecutar la pila de recuperación Nemotron en griego moderno, cubriendo cada capa desde la minería de corpus hasta un lector de mezcla de expertos ajustado con LoRA. El artículo, enviado el 5 de agosto de 2026, se dirige a RAG en sectores legales, energéticos, financieros y médicos—cuatro sectores regulados donde el griego es el idioma operacional y donde no existía ningún benchmark de recuperación a nivel de producción.

El hallazgo central desafía un atajo común: la recuperación de línea base BM25 supera a varios recuperadores densos multilingües listos para usar en corpus especializados en griego antes de cualquier ajuste fino. En HERA—un nuevo benchmark de dominio especializado que cubre texto griego especializado en derecho, energía, finanzas y medicina—el incrustador Nemotron 1B sin adaptar obtiene nDCG@10 de 0.362. Después del ajuste fino en 65.773 pares de recuperación de griego generados sintéticamente, alcanza 0.835—una ganancia de 2.3× sobre BM25. Esa línea base de 0.362 es específica para consultas de dominio especializado de HERA. Una evaluación separada en el catálogo de libros griegos CUP (arxiv 2607.21274) muestra el mismo modelo Nemotron listo para usar alcanzando nDCG@9 de 0.582 en texto académico general—un dataset, métrica y conjunto de resultados diferentes que no son directamente comparables a HERA. Las representaciones aprendidas se transfieren a griego de dominio general, aunque la ventaja de BM25 sigue siendo dependiente del dominio fuera de la distribución de entrenamiento.

El pipeline de entrenamiento está completamente automatizado. La minería de corpus recopila texto griego específico del dominio. Una etapa de supervisión sintética genera pares query–passage sin anotación manual. El bi-encoder Nemotron 1B se ajusta en 65.773 pares. Un reranker cross-encoder se adapta por separado y proporciona mejoras nDCG consistentes en todos los dominios especializados. La pila completa—incrustador, reranker, lector—se asigna directamente a las recetas de recuperación NeMo existentes de NVIDIA, que incluyen scripts de ajuste fino y rutas de destilación para los modelos Nemotron Embed 1B y 8B.

En la capa de lector, el equipo ajusta con LoRA un modelo Nemotron 30B-A3B MoE. La corrección de respuesta evaluada sube del 29.4% al 66.9%, con ganancias simultáneas en fidelidad y calidad de citación. La arquitectura 30B-A3B contiene 31.6 mil millones de parámetros totales pero activa 3.2 mil millones por pasada hacia adelante (3.6B incluyendo incrustaciones), según el informe técnico Nemotron 3 Nano. El costo de inferencia se asemeja más a un modelo denso 3B que a uno 30B—la cifra que importa para estimaciones de producción.

HERA, lanzado junto con el artículo, es la primera evaluación RAG a gran escala para griego que cubre dominios legales, energéticos y financieros. Proporciona a los equipos un objetivo de evaluación concreto en lugar de benchmarks en inglés traducidos, que tergiversan la terminología específica del griego, la gramática y el vocabulario del dominio. Tanto los modelos adaptados como el benchmark son públicos.

Cada componente—generación de pares sintéticos, ajuste fino de bi-encoder, adaptación de reranker cross-encoder, ajuste LoRA MoE—es agnóstico al idioma. Los equipos que construyen RAG para otros idiomas insuficientemente atendidos pueden replicar este pipeline. La recopilación de corpus específica del dominio es el cuello de botella principal. La calidad de la supervisión sintética determina los resultados: los 65.773 pares necesarios para mover nDCG@10 de 0.362 a 0.835 requirieron generación deliberada de consultas, no muestreo aleatorio.

Si su dominio de recuperación es estrecho y su idioma se encuentra fuera de los 10 idiomas principales de MTEB, trate BM25 como su línea base real—no un modelo de incrustación multilingüe. Presupueste al menos 50.000 pares de recuperación sintética antes de esperar que la recuperación densa entregue resultados.