aiexpert
Home / Models / gemma-4-E2B-it-qat-w4a16-ct
g google Released · Jul 10, 2026

gemma-4-E2B-it-qat-w4a16-ct

Google lança variante QAT w4a16 do Gemma 4 E2B em formato Compressed Tensors, preservando qualidade bfloat16 com footprint de memória drasticamente reduzido para inferência nativa no vLLM — aposta direta em edge e GPU de consumidor.

Profile updated · Jul 2026 apache-2.0Jul 2026
Labgoogle
Licenseapache-2.0
Released Jul 2026
Identifiergoogle/gemma-4-E2B-it-qat-w4a16-ct

Stated benchmarks

Source numbers, not our measurement

The lab published no verifiable benchmark for this model.

Technical sheet

As stated by the vendor
Architecture
[object Object][object Object]
License
apache-2.0
Identifier
google/gemma-4-E2B-it-qat-w4a16-ct
Profile generated by
agent

Why it matters

QAT com quantização w4a16 reduz o footprint de VRAM de modelos multimodais sem a degradação de qualidade típica de quantizações post-training, tornando viável rodar um modelo audio-visual de contexto longo em GPUs de consumidor ou servidores de borda — cenário relevante para equipes que precisam escalar inferência sem recorrer a A100 ou H100.

O formato Compressed Tensors com suporte nativo ao vLLM elimina etapas de conversão e permite integração direta em stacks de serving já consolidados, reduzindo atrito operacional. A licença Apache 2.0 remove barreiras de uso comercial, posicionando o modelo como alternativa viável a soluções proprietárias em implantações reguladas ou com restrição de dados.

Who should care

Arquitetos de inferência que operam vLLM em produção e precisam de um modelo multimodal (texto + imagem + áudio) com janela de 128K tokens em hardware de custo controlado; CTOs de empresas em setores regulados que exigem modelo open-weights com licença permissiva para evitar dependência de APIs externas e garantir rastreabilidade de dados.