INDUSTRYPOR AI|EXPERT SCOUT· sexta-feira, 31 de julho de 2026· 4 MIN DE LEITURA
LateOn da LightOn supera modelos 4× maiores enquanto é código aberto
Receita aberta de ponta a ponta para treinamento de modelos de recuperação: 665M pares contrastivos de 34 fontes públicas, 1.88M pares supervisionados com negativos difíceis. Dois modelos de 149M parâmetros para busca de código multilíngue e longo contexto.
Generative Imagery
Compacto supera em escala: ganhos de eficiência sem computação adicionalFIG. 01
A LightOn lançou DenseOn e LateOn em 21 de abril de 2026, dois modelos de recuperação Apache 2.0 com pontuação de 56.20 e 57.22 nDCG@10 em BEIR com 149M parâmetros. Ambos superam concorrentes com 4× mais parâmetros: Jina ColBERT v2 (559M), Arctic Embed L v2 (568M) e Qwen3-Embedding-0.6B (595M). Ambos rodam em ModernBERT com reprodutibilidade total: 665M pares de treinamento curados, 1.88M pares de ajuste fino e código de treinamento.
O treinamento começou com 1.4B pares contrastivos brutos de 34 fontes públicas, filtrados para 665M pares em inglês para pré-treinamento e 1.88M pares supervisionados via mineração de negativos difíceis. Um ganho de eficiência não exigiu computação adicional: alternar DenseOn de agrupamento médio para agrupamento CLS e adicionar prompts assimétricos de entrada—"query:" para consultas, "document:" para documentos. Este sinal explícito sobre o tipo de entrada elevou mensuravelmente as pontuações.
A contaminação de benchmarks prejudica a validade de BEIR. Os conjuntos de dados extraem fortemente de Wikipedia, MS MARCO e Common Crawl—as mesmas fontes que preenchem a maioria dos corpora de treinamento. A LightOn descontaminou usando correspondência exata de hash mais contenção de 13-gramas com ≥50% de sobreposição. Após remoção, LateOn atinge 60.36 nDCG@10 em 12 conjuntos de dados descontaminados e mantém primeiro lugar. DenseOn classifica entre os quatro primeiros. Todos os quatro modelos ColBERT mantiveram ou melhoraram a classificação sob descontaminação—ColBERT-Zero sobe do 6º para 2º lugar—enquanto as classificações de modelos densos caíram consistentemente. Ganho médio de classificação: +2.01 nDCG para modelos densos, +3.55 para ColBERT multi-vetor. Interação tardia no nível de token generaliza melhor em documentos não vistos.
Para suporte multilíngue, a LightOn traduziu dados validados em inglês para oito idiomas, produzindo um corpus de 2.8B pares. mDenseOn e mLateOn rodam em 307M parâmetros em mmBERT-base. As arquiteturas divergem quando dados de treinamento se esgotam: mDenseOn permanece forte em inglês e alvos de tradução-treinamento mas degrada em outros lugares. mLateOn generaliza para idiomas e scripts não vistos. O agrupamento MaxSim no nível de token encontra sobreposições parciais entre scripts onde similaridade de cosseno de vetor único falha.
LateOn já roda no pipeline de busca em produção da LightOn. Interação tardia requer embeddings por token, inflacionando tamanho de índice versus recuperação densa de vetor único. FastPLAID trata grandes índices multi-vetor eficientemente. DenseOn oferece o caminho com menor sobrecarga—dados de treinamento idênticos, computação idêntica, pontuações ligeiramente menores (56.20 vs. 57.22 em BEIR padrão) mas integração mais simples com infraestrutura ANN existente.
Para equipes com corpora internos e específicos de domínio, pontuações de benchmark em BEIR padrão subestimam a lacuna entre recuperação densa e de interação tardia. Com 149M parâmetros e Apache 2.0, LateOn remove barreiras de tamanho e licenciamento para avaliar recuperação ao estilo ColBERT em seus próprios dados.