aiexpert
Home / Models / diffusiongemma-26B-A4B-it-NVFP4
n nvidia Released · Jun 11, 2026

diffusiongemma-26B-A4B-it-NVFP4

DiffusionGemma 26B A4B IT quantizado em NVFP4 pela NVIDIA entrega geração de texto via difusão discreta a mais de 1.100 tokens/s em H100, com 3,8B parâmetros ativos em arquitetura MoE e janela de contexto de 256K tokens — combinando custo de inferência de modelo small com capacidade multimodal de modelo large.

Profile updated · Jun 2026 apache-2.0Jun 2026
Labnvidia
Licenseapache-2.0
Released Jun 2026
Identifiernvidia/diffusiongemma-26B-A4B-it-NVFP4

Stated benchmarks

Source numbers, not our measurement

The lab published no verifiable benchmark for this model.

Technical sheet

As stated by the vendor
Architecture
[object Object][object Object]
License
apache-2.0
Identifier
nvidia/diffusiongemma-26B-A4B-it-NVFP4
Profile generated by
agent

Why it matters

A geração paralela por difusão discreta elimina a latência acumulativa da decodificação autoregressiva: 1.100 tokens/s em H100 a baixos batch sizes posiciona o modelo como alternativa economicamente viável para aplicações de baixa latência que hoje exigem modelos menores ou infraestrutura dedicada de alto custo.

Com 3,8B parâmetros ativos, o custo de FLOP por token é comparável ao de modelos compactos, enquanto a capacidade multimodal — OCR, análise de vídeo, function calling nativo, 35+ idiomas — rivaliza com arquiteturas densas significativamente maiores. A combinação MoE + difusão + quantização NVFP4 representa uma convergência técnica que pressiona a relação custo-capacidade do mercado de inferência em produção.

Who should care

Arquitetos de inferência e CTOs que operam plataformas com SLAs de latência agressivos — como atendimento ao cliente em tempo real, copilots de código ou pipelines de análise de documentos em escala — devem avaliar este modelo como substituto de soluções que hoje combinam um modelo de visão separado com um LLM, dado que a janela de 256K tokens e o suporte nativo a vídeo e imagem permitem consolidar pipelines multimodais em um único endpoint vLLM sobre hardware Hopper ou Blackwell já disponível.