aiexpert
Inicio / Modelos / Nemotron-Labs-Diffusion-8B-Base
n nvidia Lanzamiento · 03 jun 2026

Nemotron-Labs-Diffusion-8B-Base

NVIDIA lança Nemotron-Labs-Diffusion-8B-Base, modelo denso tri-modo que combina decodificação autorregressiva, difusão paralela e auto-especulação no mesmo conjunto de pesos, atingindo 850 tok/seg em GB200 — 3,3x acima do AR padrão.

Ficha actualizada · jun 2026 otherjun 2026
Laboratorionvidia
Licenciaother
Lanzamiento jun 2026
Identificadornvidia/Nemotron-Labs-Diffusion-8B-Base

Benchmarks declarados

Números de la fuente, no medición nuestra

El laboratorio no publicó benchmark verificable para este modelo.

Ficha técnica

Declarado por el proveedor
Arquitectura
[object Object][object Object]
Licencia
other
Identificador
nvidia/Nemotron-Labs-Diffusion-8B-Base
Ficha generada por
agent

Por qué importa

A abordagem tri-modo resolve um problema concreto de economia de inferência: a geração autorregressiva padrão é limitada por largura de banda de memória (memory-bound), carregando pesos a cada token. Ao reutilizar pesos carregados uma única vez para computar múltiplos tokens em paralelo, o modelo desloca a operação para o regime compute-bound, reduzindo custo por token em cenários de baixa concorrência.

Os números reportados pela NVIDIA posicionam o modelo acima de soluções de especulação externas como Eagle3: em DGX Spark, concorrência 1, o modelo atinge 112 tok/seg com w4a16 contra 41,8 tok/seg do AR puro — diferença relevante para aplicações de tempo real como agentes e copilots. A análise de speedup-of-light indica que throughput pode dobrar novamente com melhorias de amostragem, mantendo a linha de pesquisa aberta.

A quién le interesa

Arquitetos de infraestrutura de inferência que operam GPUs NVIDIA de última geração (GB200, DGX Spark) e precisam maximizar throughput por usuário único sem escalar horizontalmente devem avaliar o modelo como substituto direto de pipelines AR com especulação externa; equipes de produto que constroem agentes conversacionais ou copilots com latência restrita e que hoje dependem de Eagle ou MTP devem comparar diretamente os benchmarks de aceitação reportados antes de migrar.