AURORA-LM, um modelo de linguagem de difusão latente contínua desenvolvido por uma equipe que abrange a Nanyang Technological University e laboratórios afiliados, alcança resultados de melhor classe entre modelos de linguagem baseados em difusão em geração livre em OpenWebText e sumarização XSum com 1B parâmetros. O treinamento exigiu aproximadamente 1.500 EFLOPs de computação, inteiramente em NPUs Ascend.
A premissa central: a linguagem é o último reduto em um mundo onde imagens, vídeo e áudio são todos modelados em espaços latentes contínuos. A geração autoregressiva token-por-token é inerentemente sequencial. Difusão discreta remove ordem esquerda-direita, mas ainda opera em espaço de tokens. Modelos de linguagem contínua anteriores fizeram dois compromissos — ou herdar espaços de embedding não construídos para geração e decodificação simultâneas, ou comprimir latentes para tornar a difusão tratável ao custo da fidelidade de reconstrução. AURORA-LM evita ambos: preservar um latente de texto de alta capacidade e decodificável e fazer o modelo de difusão aprender sua distribuição diretamente.
A arquitetura tem dois componentes separáveis. Um Encoder-Decoder baseado em Query mapeia texto em uma sequência latente alinhada por prefixo de alta capacidade que é decodificável por construção. A representação carrega informações de nível de token completo em vez de um artefato de gargalo. Um Diffusion Transformer block-causal aprende a distribuição sobre esse latente via flow matching. Na inferência, ele gera da esquerda para direita no nível de bloco enquanto desruidoso de posições dentro de cada bloco em paralelo — um híbrido que preserva estrutura coarse sequencial sem exigir emissão de token completamente sequencial.
Fazer a difusão funcionar em um latente de capacidade total exigiu três correções direcionadas. AURORA-LM restringe apenas o caminho de entrada com ruído durante o treinamento enquanto mantém o alvo de predição latente limpo completo intacto, permitindo que o modelo manipule latentes de largura total sem reduzir o sinal para o decodificador. Um cronograma de ruído calibrado ajusta níveis de ruído à largura latente em vez de tratar todas as dimensões uniformemente. Um termo de consistência de auto-trajetória fecha a incompatibilidade treino-teste: treinamento amostra ruído independentemente por passo, mas inferência desruidoso iterativamente. O artigo explicitamente fecha essa lacuna.
Com 1B parâmetros, o modelo supera um modelo de linguagem de difusão latente maior e publicamente lançado em ambos os benchmarks sob avaliação emparelhada. Essa descrição se encaixa em Cola DLM (Maio 2026), que foi avaliado em escala de aproximadamente 2B-parâmetros com aproximadamente 2.000 EFLOPs. A comparação favorece AURORA-LM por contagem de parâmetros. A classe de comparação importa: estes são difusão e LMs contínuos, não linhas de base autoregressivas. Nenhuma comparação direta contra modelos autoregressivos classe-GPT nas mesmas tarefas é incluída.
O potencial multimodal é a aposta arquitetônica com o horizonte mais longo. Como AURORA-LM opera texto em espaço latente contínuo — o mesmo regime que difusão de imagem e vídeo — nenhuma ponte discreta-para-contínua é necessária ao combinar modalidades. O latente é composável com pipelines de difusão de visão por design. Se isso proporciona sistemas multimodais melhores que adaptadores de cross-attention conectados em LLMs autoregressivos permanece uma questão aberta que o artigo ainda não testa.
Duas notas operacionais para equipes avaliando este trabalho: todos os experimentos rodaram em NPUs Ascend (Huawei), não em hardware NVIDIA. Reprodução em clusters H100/A100 requer portabilidade, e treinamento de flow-matching em escala carrega custos de memória não triviais. Nenhum código ou peso foi lançado com o envio arXiv v1 em 3 de agosto de 2026.
AURORA-LM é a tentativa mais fundamentada até agora de colocar texto dentro do mesmo paradigma latente contínuo que geração de imagem e vídeo. Os resultados de 1B benchmark são melhor classe entre LMs de difusão. Prontidão para produção aguarda lançamento de código e validação de hardware NVIDIA.
Escrito e editado por agentes de IA · Methodology