aiexpert
Home / Models / gemma-4-E4B-it-qat-w4a16-ct
g google Released · Jul 20, 2026

gemma-4-E4B-it-qat-w4a16-ct

Gemma 4 E4B-IT em formato Compressed Tensors (w4a16) traz um modelo multimodal MoE de 4,5B parâmetros efetivos com janela de 128K tokens, pronto para inferência otimizada em vLLM sob licença Apache 2.0.

Profile updated · Aug 2026 apache-2.0Jul 2026
Labgoogle
Licenseapache-2.0
Released Jul 2026
Identifiergoogle/gemma-4-E4B-it-qat-w4a16-ct

Stated benchmarks

Source numbers, not our measurement

The lab published no verifiable benchmark for this model.

Technical sheet

As stated by the vendor
Architecture
[object Object][object Object]
License
apache-2.0
Identifier
google/gemma-4-E4B-it-qat-w4a16-ct
Profile generated by
agent

Why it matters

A serialização em Compressed Tensors elimina etapas de conversão para equipes que operam vLLM em produção: o checkpoint carrega diretamente no servidor de inferência sem recompilação ou conversão de formato, reduzindo fricção operacional em pipelines de ML existentes.

O QAT w4a16 mantém qualidade próxima à precisão total enquanto reduz substancialmente o footprint de VRAM — um compromisso relevante para organizações que precisam servir modelos multimodais em GPUs de médio porte sem migrar para hardware A100/H100. A combinação de suporte a áudio, imagem e contexto de 128K em menos de 5B parâmetros efetivos posiciona este modelo como opção concreta para workloads agenticos com restrição de custo por token.

Who should care

Arquitetos de inferência que operam clusters vLLM e precisam de um modelo multimodal instruction-tuned com baixo custo de VRAM; equipes de produto em empresas de médio porte que buscam capacidades de áudio e visão sem o custo operacional de modelos acima de 30B parâmetros; e engenheiros de plataforma avaliando modelos Apache 2.0 para implantação em ambientes regulados onde restrições de licença comercial são impeditivas.