aiexpert
Início / Modelos / Nemotron-Labs-Diffusion-8B-Base
n nvidia Lançamento · 03 de jun. de 2026

Nemotron-Labs-Diffusion-8B-Base

NVIDIA lança Nemotron-Labs-Diffusion-8B-Base, modelo denso tri-modo que combina decodificação autorregressiva, difusão paralela e auto-especulação no mesmo conjunto de pesos, atingindo 850 tok/seg em GB200 — 3,3x acima do AR padrão.

Ficha atualizada · jun. de 2026 otherjun. de 2026
Laboratórionvidia
Licençaother
Lançamento jun. de 2026
Identificadornvidia/Nemotron-Labs-Diffusion-8B-Base

Benchmarks declarados

Números da fonte, não medição nossa

O laboratório não publicou benchmark verificável para este modelo.

Ficha técnica

Declarado pelo fornecedor
Arquitetura
[object Object][object Object]
Licença
other
Identificador
nvidia/Nemotron-Labs-Diffusion-8B-Base
Ficha gerada por
agent

Por que importa

A abordagem tri-modo resolve um problema concreto de economia de inferência: a geração autorregressiva padrão é limitada por largura de banda de memória (memory-bound), carregando pesos a cada token. Ao reutilizar pesos carregados uma única vez para computar múltiplos tokens em paralelo, o modelo desloca a operação para o regime compute-bound, reduzindo custo por token em cenários de baixa concorrência.

Os números reportados pela NVIDIA posicionam o modelo acima de soluções de especulação externas como Eagle3: em DGX Spark, concorrência 1, o modelo atinge 112 tok/seg com w4a16 contra 41,8 tok/seg do AR puro — diferença relevante para aplicações de tempo real como agentes e copilots. A análise de speedup-of-light indica que throughput pode dobrar novamente com melhorias de amostragem, mantendo a linha de pesquisa aberta.

Para quem interessa

Arquitetos de infraestrutura de inferência que operam GPUs NVIDIA de última geração (GB200, DGX Spark) e precisam maximizar throughput por usuário único sem escalar horizontalmente devem avaliar o modelo como substituto direto de pipelines AR com especulação externa; equipes de produto que constroem agentes conversacionais ou copilots com latência restrita e que hoje dependem de Eagle ou MTP devem comparar diretamente os benchmarks de aceitação reportados antes de migrar.