DiffusionGemma 26B A4B é um modelo multimodal MoE da Google DeepMind que substitui autogressão token-a-token por difusão discreta em blocos, atingindo mais de 1.100 tokens/s em H100 FP8 — com tradeoff mensurável de qualidade frente ao Gemma 4 base.
The lab published no verifiable benchmark for this model.
A troca entre velocidade e qualidade está documentada nos próprios benchmarks da Google: DiffusionGemma marca 69,1% no AIME 2026 contra 88,3% do Gemma 4 26B A4B, e 77,6% no MMLU Pro contra 82,6% do baseline — degradação real em raciocínio complexo e visão. O HLE sem ferramentas é exceção, onde DiffusionGemma supera o Gemma 4 (11,0% vs 8,7%).
Para casos de uso com restrição de latência e volume alto de requisições em batch pequeno — como interfaces conversacionais, copilots de código e pipelines de extração documental — um throughput acima de 1.100 tokens/s em hardware de ponta representa redução concreta de custo por token e viabilidade de execução local em infraestrutura dedicada.
CTOs e arquitetos de plataformas conversacionais que precisam reduzir latência percebida em produção sem escalar horizontalmente, engenheiros de MLOps avaliando inferência local em aceleradores únicos, e equipes de produto construindo copilots de código ou extração de documentos onde volume de tokens por segundo é gargalo operacional direto — desde que tolerem a queda de desempenho em raciocínio matemático e tarefas multimodais complexas.