aiexpert
Início / Modelos / gemma-4-E2B-it-qat-w4a16-ct
g google Lançamento · 10 de jul. de 2026

gemma-4-E2B-it-qat-w4a16-ct

Google lança variante QAT w4a16 do Gemma 4 E2B em formato Compressed Tensors, preservando qualidade bfloat16 com footprint de memória drasticamente reduzido para inferência nativa no vLLM — aposta direta em edge e GPU de consumidor.

Ficha atualizada · jul. de 2026 apache-2.0jul. de 2026
Laboratóriogoogle
Licençaapache-2.0
Lançamento jul. de 2026
Identificadorgoogle/gemma-4-E2B-it-qat-w4a16-ct

Benchmarks declarados

Números da fonte, não medição nossa

O laboratório não publicou benchmark verificável para este modelo.

Ficha técnica

Declarado pelo fornecedor
Arquitetura
[object Object][object Object]
Licença
apache-2.0
Identificador
google/gemma-4-E2B-it-qat-w4a16-ct
Ficha gerada por
agent

Por que importa

QAT com quantização w4a16 reduz o footprint de VRAM de modelos multimodais sem a degradação de qualidade típica de quantizações post-training, tornando viável rodar um modelo audio-visual de contexto longo em GPUs de consumidor ou servidores de borda — cenário relevante para equipes que precisam escalar inferência sem recorrer a A100 ou H100.

O formato Compressed Tensors com suporte nativo ao vLLM elimina etapas de conversão e permite integração direta em stacks de serving já consolidados, reduzindo atrito operacional. A licença Apache 2.0 remove barreiras de uso comercial, posicionando o modelo como alternativa viável a soluções proprietárias em implantações reguladas ou com restrição de dados.

Para quem interessa

Arquitetos de inferência que operam vLLM em produção e precisam de um modelo multimodal (texto + imagem + áudio) com janela de 128K tokens em hardware de custo controlado; CTOs de empresas em setores regulados que exigem modelo open-weights com licença permissiva para evitar dependência de APIs externas e garantir rastreabilidade de dados.