aiexpert
Início / Modelos / gemma-4-E4B-it-qat-w4a16-ct
g google Lançamento · 20 de jul. de 2026

gemma-4-E4B-it-qat-w4a16-ct

Gemma 4 E4B-IT em formato Compressed Tensors (w4a16) traz um modelo multimodal MoE de 4,5B parâmetros efetivos com janela de 128K tokens, pronto para inferência otimizada em vLLM sob licença Apache 2.0.

Ficha atualizada · ago. de 2026 apache-2.0jul. de 2026
Laboratóriogoogle
Licençaapache-2.0
Lançamento jul. de 2026
Identificadorgoogle/gemma-4-E4B-it-qat-w4a16-ct

Benchmarks declarados

Números da fonte, não medição nossa

O laboratório não publicou benchmark verificável para este modelo.

Ficha técnica

Declarado pelo fornecedor
Arquitetura
[object Object][object Object]
Licença
apache-2.0
Identificador
google/gemma-4-E4B-it-qat-w4a16-ct
Ficha gerada por
agent

Por que importa

A serialização em Compressed Tensors elimina etapas de conversão para equipes que operam vLLM em produção: o checkpoint carrega diretamente no servidor de inferência sem recompilação ou conversão de formato, reduzindo fricção operacional em pipelines de ML existentes.

O QAT w4a16 mantém qualidade próxima à precisão total enquanto reduz substancialmente o footprint de VRAM — um compromisso relevante para organizações que precisam servir modelos multimodais em GPUs de médio porte sem migrar para hardware A100/H100. A combinação de suporte a áudio, imagem e contexto de 128K em menos de 5B parâmetros efetivos posiciona este modelo como opção concreta para workloads agenticos com restrição de custo por token.

Para quem interessa

Arquitetos de inferência que operam clusters vLLM e precisam de um modelo multimodal instruction-tuned com baixo custo de VRAM; equipes de produto em empresas de médio porte que buscam capacidades de áudio e visão sem o custo operacional de modelos acima de 30B parâmetros; e engenheiros de plataforma avaliando modelos Apache 2.0 para implantação em ambientes regulados onde restrições de licença comercial são impeditivas.