aiexpert
Início / Notícias / Nota
Research · 14 de ago. de 2026, 18:34 · 5 fontes

Alibaba abre pesos Qwen3.8-27B: modelo multimodal de 27B para inferência local em GPU única, licenciado Apache 2.0

Alibaba lançou pesos abertos para Qwen3.8-27B, um modelo multimodal denso de 27 bilhões de parâmetros que supera seu antecessor Qwen3.7-Plus e se destaca em fluxos de trabalho de codificação e escritório. O modelo suporta entradas de texto, imagem e vídeo nativamente e vem com janela de contexto de 262K tokens extensível para 1M via YaRN. Licenciado sob Apache 2.0, a versão 27B é posicionada como a camada prática de auto-hospedagem da família Qwen3.8, complementando o Qwen3.8-Max de flagship (2.4 trilhões de parâmetros, apenas API/hospedado).

Qwen3.8-27B foi projetado para inferência local de GPU única visando hardware consumer com ~24GB VRAM (classe RTX 4090). Em quantização de 4 bits, o modelo se encaixa em implantações realistas com ~16–17 GB de carga útil de peso mais cache KV (~20–24 GB de VRAM total na prática). Construtores da comunidade publicaram imediatamente construções GGUF no Hugging Face; Unsloth lançou GGUFs dinâmicos poucas horas após o anúncio, permitindo inferência sem dependências externas.

Esta é uma mudança estratégica para Alibaba: modelos Qwen Max anteriores (3.6-Plus, 3.7-Max, 3.7-Plus) permaneceram proprietários/apenas API. A geração 3.8 retorna ao licenciamento Apache 2.0 aberto que caracterizou as primeiras versões da Qwen, estendendo essa abertura para camadas Max e 27B. O lançamento vem em meio à intensificação da competição no mercado de inferência local, onde Llama 3.1, Nemotron e modelos abertos DeepSeek competem pela atenção de desenvolvedores.

Para arquitetos de infraestrutura enviando em produção: isso remove dependência de nuvem (latência, custo, aprisionamento de fornecedor, residência de dados). A capacidade multimodal abre análise de documentos (extração de PDF/gráficos), compreensão de conteúdo de vídeo e assistentes de codificação visual. O desempenho de codificação herdado dos ganhos de treinamento da geração 3.8 sugere uso de ferramentas sólido e raciocínio de agentes na escala 27B, abordando a lacuna entre destilações de 7B e requisitos de 70B+ parâmetros. Espere adoção rápida em indústrias reguladas (finanças, saúde) onde inferência no local é crítica para conformidade.

Fontes

Tudo que sustenta esta nota
  1. 01 Primary source x.com
  2. 02 Alibaba Qwen on X: Qwen3.8-27B open weights released x.com “We promised open weights for Qwen3.8. Now, time to meet them! Qwen3.8-27B: A native multimodal dense model. With just 27B parameters, it outperforms Qwen3.7-Plus overall and shines in real-world coding & office workflows.”
  3. 03 Crypto Briefing: Alibaba releases open weights for Qwen3.8-27B multimodal model cryptobriefing.com “Alibaba designed this model for practical local inference, targeting hardware with around 24GB of VRAM, the kind of GPU memory found in a high-end consumer graphics card like an NVIDIA RTX 4090”
  4. 04 Crypto Briefing: Alibaba releases open weights for Qwen3.8-27B multimodal model cryptobriefing.com “The 27B model sits at the lighter end of Alibaba's new Qwen3.8 family. Its bigger sibling, the Qwen3.8-Max, features 2.4 trillion total parameters”
  5. 05 Crypto Briefing: Alibaba releases open weights for Qwen3.8-27B multimodal model cryptobriefing.com “Local deployment capability matters because it removes dependency on cloud providers, reduces latency, keeps sensitive data on-premise, and drops the cost of experimentation”