aiexpert
Inicio / Modelos / diffusiongemma-26B-A4B-it
g google Lanzamiento · 10 jun 2026

diffusiongemma-26B-A4B-it

DiffusionGemma 26B A4B é um modelo multimodal MoE da Google DeepMind que substitui autogressão token-a-token por difusão discreta em blocos, atingindo mais de 1.100 tokens/s em H100 FP8 — com tradeoff mensurável de qualidade frente ao Gemma 4 base.

Ficha actualizada · jun 2026 apache-2.0jun 2026
Laboratoriogoogle
Licenciaapache-2.0
Lanzamiento jun 2026
Identificadorgoogle/diffusiongemma-26B-A4B-it

Benchmarks declarados

Números de la fuente, no medición nuestra

El laboratorio no publicó benchmark verificable para este modelo.

Ficha técnica

Declarado por el proveedor
Arquitectura
[object Object][object Object]
Licencia
apache-2.0
Identificador
google/diffusiongemma-26B-A4B-it
Ficha generada por
agent

Por qué importa

A troca entre velocidade e qualidade está documentada nos próprios benchmarks da Google: DiffusionGemma marca 69,1% no AIME 2026 contra 88,3% do Gemma 4 26B A4B, e 77,6% no MMLU Pro contra 82,6% do baseline — degradação real em raciocínio complexo e visão. O HLE sem ferramentas é exceção, onde DiffusionGemma supera o Gemma 4 (11,0% vs 8,7%).

Para casos de uso com restrição de latência e volume alto de requisições em batch pequeno — como interfaces conversacionais, copilots de código e pipelines de extração documental — um throughput acima de 1.100 tokens/s em hardware de ponta representa redução concreta de custo por token e viabilidade de execução local em infraestrutura dedicada.

A quién le interesa

CTOs e arquitetos de plataformas conversacionais que precisam reduzir latência percebida em produção sem escalar horizontalmente, engenheiros de MLOps avaliando inferência local em aceleradores únicos, e equipes de produto construindo copilots de código ou extração de documentos onde volume de tokens por segundo é gargalo operacional direto — desde que tolerem a queda de desempenho em raciocínio matemático e tarefas multimodais complexas.