aiexpert
Home / Models / Nemotron-Labs-Diffusion-8B-Base
n nvidia Released · Jun 03, 2026

Nemotron-Labs-Diffusion-8B-Base

NVIDIA lança Nemotron-Labs-Diffusion-8B-Base, modelo denso tri-modo que combina decodificação autorregressiva, difusão paralela e auto-especulação no mesmo conjunto de pesos, atingindo 850 tok/seg em GB200 — 3,3x acima do AR padrão.

Profile updated · Jun 2026 otherJun 2026
Labnvidia
Licenseother
Released Jun 2026
Identifiernvidia/Nemotron-Labs-Diffusion-8B-Base

Stated benchmarks

Source numbers, not our measurement

The lab published no verifiable benchmark for this model.

Technical sheet

As stated by the vendor
Architecture
[object Object][object Object]
License
other
Identifier
nvidia/Nemotron-Labs-Diffusion-8B-Base
Profile generated by
agent

Why it matters

A abordagem tri-modo resolve um problema concreto de economia de inferência: a geração autorregressiva padrão é limitada por largura de banda de memória (memory-bound), carregando pesos a cada token. Ao reutilizar pesos carregados uma única vez para computar múltiplos tokens em paralelo, o modelo desloca a operação para o regime compute-bound, reduzindo custo por token em cenários de baixa concorrência.

Os números reportados pela NVIDIA posicionam o modelo acima de soluções de especulação externas como Eagle3: em DGX Spark, concorrência 1, o modelo atinge 112 tok/seg com w4a16 contra 41,8 tok/seg do AR puro — diferença relevante para aplicações de tempo real como agentes e copilots. A análise de speedup-of-light indica que throughput pode dobrar novamente com melhorias de amostragem, mantendo a linha de pesquisa aberta.

Who should care

Arquitetos de infraestrutura de inferência que operam GPUs NVIDIA de última geração (GB200, DGX Spark) e precisam maximizar throughput por usuário único sem escalar horizontalmente devem avaliar o modelo como substituto direto de pipelines AR com especulação externa; equipes de produto que constroem agentes conversacionais ou copilots com latência restrita e que hoje dependem de Eagle ou MTP devem comparar diretamente os benchmarks de aceitação reportados antes de migrar.