aiexpert
Home / Models
Profiles generated by the newsroom

Model catalogue

One profile per model: what the lab stated, the benchmarks it published and the coverage the model appeared in. The numbers come from the source — we run no evaluation of our own.

53Models
11Labs
google

gemma-4-E4B-it-qat-w4a16-ct

Gemma 4 E4B-IT em formato Compressed Tensors (w4a16) traz um modelo multimodal MoE de 4,5B parâmetros efetivos com janela de 128K tokens, pronto para inferência otimizada em vLLM sob licença Apache 2.0.

Released Jul 2026 · apache-2.0 No benchmark stated
google

gemma-4-E2B-it-qat-w4a16-ct

Google lança variante QAT w4a16 do Gemma 4 E2B em formato Compressed Tensors, preservando qualidade bfloat16 com footprint de memória drasticamente reduzido para inferência nativa no vLLM — aposta direta em edge e GPU de consumidor.

Released Jul 2026 · apache-2.0 No benchmark stated
google

diffusiongemma-26B-A4B-it

DiffusionGemma 26B A4B é um modelo multimodal MoE da Google DeepMind que substitui autogressão token-a-token por difusão discreta em blocos, atingindo mais de 1.100 tokens/s em H100 FP8 — com tradeoff mensurável de qualidade frente ao Gemma 4 base.

Released Jun 2026 · apache-2.0 No benchmark stated
google

gemma-4-12B-it-qat-w4a16-ct

Google lança Gemma 4 12B em formato QAT w4a16 via compressed-tensors, viabilizando inferência otimizada no vLLM com qualidade próxima ao bfloat16 e janela de contexto de 256K tokens sob licença Apache 2.0.

Released Jun 2026 · apache-2.0 No benchmark stated
google

gemma-4-31B-it-qat-w4a16-ct

Google DeepMind lança versão quantizada com QAT do Gemma 4 31B denso em formato compressed-tensors w4a16, permitindo inferência nativa no vLLM com qualidade próxima ao bfloat16 e footprint de memória drasticamente reduzido — relevante para equipes que precisam rodar 31B parâmetros em hardware de workstation.

Released Jun 2026 · apache-2.0 No benchmark stated
google

gemma-4-E2B-it

Gemma 4 E2B é um modelo denso multimodal de 2,3B parâmetros efetivos (5,1B com embeddings) da Google DeepMind, licenciado em Apache 2.0, com suporte a texto, imagem e áudio em janela de contexto de 128K tokens — posicionado para inferência local em dispositivos móveis e laptops.

Released May 2026 · apache-2.0 No benchmark stated
google

gemma-4-E4B-it

Gemma 4 E4B é um modelo denso multimodal de 4,5B parâmetros efetivos (8B com embeddings) da Google DeepMind, licenciado em Apache 2.0, com janela de contexto de 128K tokens e suporte nativo a texto, imagem e áudio — projetado para execução local em laptops e dispositivos móveis.

Released May 2026 · apache-2.0 No benchmark stated
google

gemma-4-26B-A4B-it

Gemma 4 26B A4B é um modelo MoE multimodal do Google DeepMind com 25,2B parâmetros totais e apenas 3,8B ativos por inferência, janela de 256K tokens e licença Apache 2.0 — entregando desempenho próximo ao 31B denso com custo computacional de um modelo 4B.

Released May 2026 · apache-2.0 No benchmark stated
google

gemma-4-31B-it

Gemma 4 31B é um modelo denso multimodal de 30,7B parâmetros, Apache 2.0, com janela de 256K tokens e 89,2% no AIME 2026 sem ferramentas — desempenho de raciocínio que rivaliza com modelos proprietários de maior escala.

Released May 2026 · apache-2.0 No benchmark stated
google

gemma-4-E2B

Gemma 4 E2B é um modelo denso multimodal de 2,3B parâmetros efetivos (5,1B com embeddings) da Google DeepMind, licenciado sob Apache 2.0, otimizado para execução local em dispositivos móveis e laptops com suporte a texto, imagem e áudio em janela de contexto de 128K tokens.

Released Apr 2026 · apache-2.0 No benchmark stated

Where the numbers come from

Every profile keeps the list of sources the numbers came from. No index on this page is produced by us — when the lab does not disclose, the profile says so.

Read the methodology