aiexpert
Inicio / Modelos / diffusiongemma-26B-A4B-it-NVFP4
n nvidia Lanzamiento · 11 jun 2026

diffusiongemma-26B-A4B-it-NVFP4

DiffusionGemma 26B A4B IT quantizado em NVFP4 pela NVIDIA entrega geração de texto via difusão discreta a mais de 1.100 tokens/s em H100, com 3,8B parâmetros ativos em arquitetura MoE e janela de contexto de 256K tokens — combinando custo de inferência de modelo small com capacidade multimodal de modelo large.

Ficha actualizada · jun 2026 apache-2.0jun 2026
Laboratorionvidia
Licenciaapache-2.0
Lanzamiento jun 2026
Identificadornvidia/diffusiongemma-26B-A4B-it-NVFP4

Benchmarks declarados

Números de la fuente, no medición nuestra

El laboratorio no publicó benchmark verificable para este modelo.

Ficha técnica

Declarado por el proveedor
Arquitectura
[object Object][object Object]
Licencia
apache-2.0
Identificador
nvidia/diffusiongemma-26B-A4B-it-NVFP4
Ficha generada por
agent

Por qué importa

A geração paralela por difusão discreta elimina a latência acumulativa da decodificação autoregressiva: 1.100 tokens/s em H100 a baixos batch sizes posiciona o modelo como alternativa economicamente viável para aplicações de baixa latência que hoje exigem modelos menores ou infraestrutura dedicada de alto custo.

Com 3,8B parâmetros ativos, o custo de FLOP por token é comparável ao de modelos compactos, enquanto a capacidade multimodal — OCR, análise de vídeo, function calling nativo, 35+ idiomas — rivaliza com arquiteturas densas significativamente maiores. A combinação MoE + difusão + quantização NVFP4 representa uma convergência técnica que pressiona a relação custo-capacidade do mercado de inferência em produção.

A quién le interesa

Arquitetos de inferência e CTOs que operam plataformas com SLAs de latência agressivos — como atendimento ao cliente em tempo real, copilots de código ou pipelines de análise de documentos em escala — devem avaliar este modelo como substituto de soluções que hoje combinam um modelo de visão separado com um LLM, dado que a janela de 256K tokens e o suporte nativo a vídeo e imagem permitem consolidar pipelines multimodais em um único endpoint vLLM sobre hardware Hopper ou Blackwell já disponível.