INDUSTRYPOR AI|EXPERT SCOUT· viernes, 31 de julio de 2026· 4 MIN DE LECTURA
LateOn de LightOn supera modelos 4× más grandes siendo de código abierto
Receta abierta de extremo a extremo para entrenar modelos de recuperación: 665M pares contrastivos de 34 fuentes públicas, 1.88M pares supervisados con negativos difíciles. Dos modelos de 149M parámetros para búsqueda multilingüe de código en largo contexto.
Generative Imagery
Compacto supera a escala: ganancias de eficiencia sin computación adicionalFIG. 01
LightOn lanzó DenseOn y LateOn el 21 de abril de 2026, dos modelos de recuperación Apache 2.0 con puntuaciones de 56.20 y 57.22 nDCG@10 en BEIR con 149M parámetros. Ambos superan competidores con 4× más parámetros: Jina ColBERT v2 (559M), Arctic Embed L v2 (568M) y Qwen3-Embedding-0.6B (595M). Ambos se ejecutan en ModernBERT con reproducibilidad total: 665M pares de entrenamiento curados, 1.88M pares de ajuste fino y código de entrenamiento.
El entrenamiento comenzó con 1.4B pares contrastivos sin filtrar de 34 fuentes públicas, filtrados a 665M pares en inglés para preentrenamiento y 1.88M pares supervisados mediante minería de negativos difíciles. Una ganancia de eficiencia no requirió computación adicional: cambiar DenseOn de agrupamiento promedio a agrupamiento CLS e introducir solicitudes de entrada asimétricas—"query:" para consultas, "document:" para documentos. Esta señal explícita sobre el tipo de entrada elevó mediblemente las puntuaciones.
La contaminación de benchmarks socava la validez de BEIR. Los conjuntos de datos se extraen fuertemente de Wikipedia, MS MARCO y Common Crawl—las mismas fuentes que llenan la mayoría de los corpus de entrenamiento. LightOn descontaminó mediante correspondencia de hash exacta más contención de 13-gramas con ≥50% de superposición. Tras la eliminación, LateOn alcanza 60.36 nDCG@10 en 12 conjuntos de datos descontaminados y ocupa el primer lugar. DenseOn ocupa uno de los cuatro primeros lugares. Los cuatro modelos ColBERT mantuvieron o mejoraron la clasificación bajo descontaminación—ColBERT-Zero sube del 6º al 2º lugar—mientras que las clasificaciones de modelos densos cayeron consistentemente. Ganancia de clasificación promedio: +2.01 nDCG para modelos densos, +3.55 para ColBERT multivector. La interacción tardía a nivel de token generaliza mejor en documentos no vistos.
Para soporte multilingüe, LightOn tradujo datos validados en inglés a ocho idiomas, produciendo un corpus de 2.8B pares. mDenseOn y mLateOn se ejecutan a 307M parámetros en mmBERT-base. Las arquitecturas divergen cuando se agotan los datos de entrenamiento: mDenseOn se mantiene fuerte en inglés y objetivos de traducción-entrenamiento pero se degrada en otros lugares. mLateOn generaliza a idiomas y escrituras no vistos. La coincidencia MaxSim a nivel de token encuentra superposiciones parciales entre escrituras donde la similitud de coseno de un solo vector falla.
LateOn ya se ejecuta en la canalización de búsqueda en producción de LightOn. La interacción tardía requiere embeddings por token, inflando el tamaño del índice versus recuperación densa de un solo vector. FastPLAID maneja grandes índices multivector de manera eficiente. DenseOn ofrece el camino de menor sobrecarga—datos de entrenamiento idénticos, computación idéntica, puntuaciones ligeramente menores (56.20 vs. 57.22 en BEIR estándar) pero integración más simple con infraestructura ANN existente.
Para equipos con corpus internos específicos de dominio, las puntuaciones de referencia en BEIR estándar subestiman la brecha entre recuperación densa e interacción tardía. Con 149M parámetros y Apache 2.0, LateOn elimina barreras de tamaño y licencia para evaluar la recuperación al estilo ColBERT en sus propios datos.