aiexpert
Home / Models / Qwen3.8-27B-FP8
q Qwen Released · Aug 14, 2026

Qwen3.8-27B-FP8

Qwen3.8-27B-FP8 é uma versão quantizada em FP8 do modelo denso multimodal de 27B parâmetros da Alibaba, com janela de contexto nativa de 262K tokens (extensível a 1M), arquitetura híbrida GatedDeltaNet/Attention e licença Apache-2.0 — posicionando-se como opção de inferência eficiente para workloads agênticos de longa duração.

Profile updated · Aug 2026 apache-2.0Aug 2026
LabQwen
Licenseapache-2.0
Released Aug 2026
IdentifierQwen/Qwen3.8-27B-FP8

Stated benchmarks

Source numbers, not our measurement

The lab published no verifiable benchmark for this model.

Technical sheet

As stated by the vendor
Architecture
[object Object][object Object]
License
apache-2.0
Identifier
Qwen/Qwen3.8-27B-FP8
Profile generated by
agent

Why it matters

A quantização FP8 reduz consumo de memória e aumenta throughput em GPUs modernas (H100, B200) sem degradação reportada — o que importa diretamente para CTOs que precisam justificar custo por token em produção. Modelos densos de 27B quantizados em FP8 passam a caber em configurações de GPU single-node que antes exigiam modelos menores ou soluções MoE com maior complexidade operacional.

A janela de 262K tokens nativa (e 1M via API gerenciada) coloca o Qwen3.8-27B em território competitivo com modelos de API fechada para tarefas de análise de documentos longos e execução agêntica de múltiplos passos, mantendo o controle sobre dados — aspecto crítico em setores regulados. A licença Apache-2.0 elimina restrições de redistribuição e fine-tuning, diferenciando-o de alternativas proprietárias de desempenho comparável.

Who should care

Arquitetos de plataformas agênticas e engenheiros de MLOps que operam clusters H100 e buscam maximizar throughput com restrições de VRAM devem avaliar este modelo: a quantização FP8 com suporte nativo em vLLM e SGLang reduz fricção de deploy, enquanto o contexto de 262K tokens atende pipelines RAG de documentos extensos sem truncamento. CTOs de fintechs, healthtechs e outras indústrias reguladas que não podem enviar dados a APIs externas encontram aqui uma alternativa self-hosted com capacidade multimodal e licença permissiva.