aiexpert
Início / Modelos / diffusiongemma-26B-A4B-it
g google Lançamento · 10 de jun. de 2026

diffusiongemma-26B-A4B-it

DiffusionGemma 26B A4B é um modelo multimodal MoE da Google DeepMind que substitui autogressão token-a-token por difusão discreta em blocos, atingindo mais de 1.100 tokens/s em H100 FP8 — com tradeoff mensurável de qualidade frente ao Gemma 4 base.

Ficha atualizada · jun. de 2026 apache-2.0jun. de 2026
Laboratóriogoogle
Licençaapache-2.0
Lançamento jun. de 2026
Identificadorgoogle/diffusiongemma-26B-A4B-it

Benchmarks declarados

Números da fonte, não medição nossa

O laboratório não publicou benchmark verificável para este modelo.

Ficha técnica

Declarado pelo fornecedor
Arquitetura
[object Object][object Object]
Licença
apache-2.0
Identificador
google/diffusiongemma-26B-A4B-it
Ficha gerada por
agent

Por que importa

A troca entre velocidade e qualidade está documentada nos próprios benchmarks da Google: DiffusionGemma marca 69,1% no AIME 2026 contra 88,3% do Gemma 4 26B A4B, e 77,6% no MMLU Pro contra 82,6% do baseline — degradação real em raciocínio complexo e visão. O HLE sem ferramentas é exceção, onde DiffusionGemma supera o Gemma 4 (11,0% vs 8,7%).

Para casos de uso com restrição de latência e volume alto de requisições em batch pequeno — como interfaces conversacionais, copilots de código e pipelines de extração documental — um throughput acima de 1.100 tokens/s em hardware de ponta representa redução concreta de custo por token e viabilidade de execução local em infraestrutura dedicada.

Para quem interessa

CTOs e arquitetos de plataformas conversacionais que precisam reduzir latência percebida em produção sem escalar horizontalmente, engenheiros de MLOps avaliando inferência local em aceleradores únicos, e equipes de produto construindo copilots de código ou extração de documentos onde volume de tokens por segundo é gargalo operacional direto — desde que tolerem a queda de desempenho em raciocínio matemático e tarefas multimodais complexas.