Gemma 4 E4B-IT em formato Compressed Tensors (w4a16) traz um modelo multimodal MoE de 4,5B parâmetros efetivos com janela de 128K tokens, pronto para inferência otimizada em vLLM sob licença Apache 2.0.
The lab published no verifiable benchmark for this model.
A serialização em Compressed Tensors elimina etapas de conversão para equipes que operam vLLM em produção: o checkpoint carrega diretamente no servidor de inferência sem recompilação ou conversão de formato, reduzindo fricção operacional em pipelines de ML existentes.
O QAT w4a16 mantém qualidade próxima à precisão total enquanto reduz substancialmente o footprint de VRAM — um compromisso relevante para organizações que precisam servir modelos multimodais em GPUs de médio porte sem migrar para hardware A100/H100. A combinação de suporte a áudio, imagem e contexto de 128K em menos de 5B parâmetros efetivos posiciona este modelo como opção concreta para workloads agenticos com restrição de custo por token.
Arquitetos de inferência que operam clusters vLLM e precisam de um modelo multimodal instruction-tuned com baixo custo de VRAM; equipes de produto em empresas de médio porte que buscam capacidades de áudio e visão sem o custo operacional de modelos acima de 30B parâmetros; e engenheiros de plataforma avaliando modelos Apache 2.0 para implantação em ambientes regulados onde restrições de licença comercial são impeditivas.