aiexpert
Inicio / Modelos / gemma-4-E2B-it-qat-w4a16-ct
g google Lanzamiento · 10 jul 2026

gemma-4-E2B-it-qat-w4a16-ct

Google lança variante QAT w4a16 do Gemma 4 E2B em formato Compressed Tensors, preservando qualidade bfloat16 com footprint de memória drasticamente reduzido para inferência nativa no vLLM — aposta direta em edge e GPU de consumidor.

Ficha actualizada · jul 2026 apache-2.0jul 2026
Laboratoriogoogle
Licenciaapache-2.0
Lanzamiento jul 2026
Identificadorgoogle/gemma-4-E2B-it-qat-w4a16-ct

Benchmarks declarados

Números de la fuente, no medición nuestra

El laboratorio no publicó benchmark verificable para este modelo.

Ficha técnica

Declarado por el proveedor
Arquitectura
[object Object][object Object]
Licencia
apache-2.0
Identificador
google/gemma-4-E2B-it-qat-w4a16-ct
Ficha generada por
agent

Por qué importa

QAT com quantização w4a16 reduz o footprint de VRAM de modelos multimodais sem a degradação de qualidade típica de quantizações post-training, tornando viável rodar um modelo audio-visual de contexto longo em GPUs de consumidor ou servidores de borda — cenário relevante para equipes que precisam escalar inferência sem recorrer a A100 ou H100.

O formato Compressed Tensors com suporte nativo ao vLLM elimina etapas de conversão e permite integração direta em stacks de serving já consolidados, reduzindo atrito operacional. A licença Apache 2.0 remove barreiras de uso comercial, posicionando o modelo como alternativa viável a soluções proprietárias em implantações reguladas ou com restrição de dados.

A quién le interesa

Arquitetos de inferência que operam vLLM em produção e precisam de um modelo multimodal (texto + imagem + áudio) com janela de 128K tokens em hardware de custo controlado; CTOs de empresas em setores regulados que exigem modelo open-weights com licença permissiva para evitar dependência de APIs externas e garantir rastreabilidade de dados.