NVIDIA lança Nemotron-Labs-Diffusion-8B-Base, modelo denso tri-modo que combina decodificação autorregressiva, difusão paralela e auto-especulação no mesmo conjunto de pesos, atingindo 850 tok/seg em GB200 — 3,3x acima do AR padrão.
The lab published no verifiable benchmark for this model.
A abordagem tri-modo resolve um problema concreto de economia de inferência: a geração autorregressiva padrão é limitada por largura de banda de memória (memory-bound), carregando pesos a cada token. Ao reutilizar pesos carregados uma única vez para computar múltiplos tokens em paralelo, o modelo desloca a operação para o regime compute-bound, reduzindo custo por token em cenários de baixa concorrência.
Os números reportados pela NVIDIA posicionam o modelo acima de soluções de especulação externas como Eagle3: em DGX Spark, concorrência 1, o modelo atinge 112 tok/seg com w4a16 contra 41,8 tok/seg do AR puro — diferença relevante para aplicações de tempo real como agentes e copilots. A análise de speedup-of-light indica que throughput pode dobrar novamente com melhorias de amostragem, mantendo a linha de pesquisa aberta.
Arquitetos de infraestrutura de inferência que operam GPUs NVIDIA de última geração (GB200, DGX Spark) e precisam maximizar throughput por usuário único sem escalar horizontalmente devem avaliar o modelo como substituto direto de pipelines AR com especulação externa; equipes de produto que constroem agentes conversacionais ou copilots com latência restrita e que hoje dependem de Eagle ou MTP devem comparar diretamente os benchmarks de aceitação reportados antes de migrar.