aiexpert
Inicio / Modelos
Fichas generadas por la redacción

Catálogo de modelos

Una ficha por modelo: lo que el laboratorio declaró, los benchmarks que publicó y la cobertura en que apareció. Los números son de la fuente — no hacemos evaluación propia.

48Modelos
11Laboratorios
google

gemma-4-E2B-it-qat-w4a16-ct

Google lança variante QAT w4a16 do Gemma 4 E2B em formato Compressed Tensors, preservando qualidade bfloat16 com footprint de memória drasticamente reduzido para inferência nativa no vLLM — aposta direta em edge e GPU de consumidor.

Lanzado jul 2026 · apache-2.0 Sin benchmark declarado
google

diffusiongemma-26B-A4B-it

DiffusionGemma 26B A4B é um modelo multimodal MoE da Google DeepMind que substitui autogressão token-a-token por difusão discreta em blocos, atingindo mais de 1.100 tokens/s em H100 FP8 — com tradeoff mensurável de qualidade frente ao Gemma 4 base.

Lanzado jun 2026 · apache-2.0 Sin benchmark declarado
google

gemma-4-12B-it-qat-w4a16-ct

Google lança Gemma 4 12B em formato QAT w4a16 via compressed-tensors, viabilizando inferência otimizada no vLLM com qualidade próxima ao bfloat16 e janela de contexto de 256K tokens sob licença Apache 2.0.

Lanzado jun 2026 · apache-2.0 Sin benchmark declarado
google

gemma-4-31B-it-qat-w4a16-ct

Google DeepMind lança versão quantizada com QAT do Gemma 4 31B denso em formato compressed-tensors w4a16, permitindo inferência nativa no vLLM com qualidade próxima ao bfloat16 e footprint de memória drasticamente reduzido — relevante para equipes que precisam rodar 31B parâmetros em hardware de workstation.

Lanzado jun 2026 · apache-2.0 Sin benchmark declarado
google

gemma-4-E2B-it

Gemma 4 E2B é um modelo denso multimodal de 2,3B parâmetros efetivos (5,1B com embeddings) da Google DeepMind, licenciado em Apache 2.0, com suporte a texto, imagem e áudio em janela de contexto de 128K tokens — posicionado para inferência local em dispositivos móveis e laptops.

Lanzado may 2026 · apache-2.0 Sin benchmark declarado
google

gemma-4-E4B-it

Gemma 4 E4B é um modelo denso multimodal de 4,5B parâmetros efetivos (8B com embeddings) da Google DeepMind, licenciado em Apache 2.0, com janela de contexto de 128K tokens e suporte nativo a texto, imagem e áudio — projetado para execução local em laptops e dispositivos móveis.

Lanzado may 2026 · apache-2.0 Sin benchmark declarado
google

gemma-4-26B-A4B-it

Gemma 4 26B A4B é um modelo MoE multimodal do Google DeepMind com 25,2B parâmetros totais e apenas 3,8B ativos por inferência, janela de 256K tokens e licença Apache 2.0 — entregando desempenho próximo ao 31B denso com custo computacional de um modelo 4B.

Lanzado may 2026 · apache-2.0 Sin benchmark declarado
google

gemma-4-31B-it

Gemma 4 31B é um modelo denso multimodal de 30,7B parâmetros, Apache 2.0, com janela de 256K tokens e 89,2% no AIME 2026 sem ferramentas — desempenho de raciocínio que rivaliza com modelos proprietários de maior escala.

Lanzado may 2026 · apache-2.0 Sin benchmark declarado
google

gemma-4-E2B

Gemma 4 E2B é um modelo denso multimodal de 2,3B parâmetros efetivos (5,1B com embeddings) da Google DeepMind, licenciado sob Apache 2.0, otimizado para execução local em dispositivos móveis e laptops com suporte a texto, imagem e áudio em janela de contexto de 128K tokens.

Lanzado abr 2026 · apache-2.0 Sin benchmark declarado

De dónde vienen los números

Cada ficha guarda la lista de fuentes de donde salieron los números. Ningún índice de esta página lo producimos nosotros — cuando el laboratorio no divulga, la ficha lo dice.

Leer la metodología