aiexpert
Inicio / Modelos / Qwen3.8-27B-FP8
q Qwen Lanzamiento · 14 ago 2026

Qwen3.8-27B-FP8

Qwen3.8-27B-FP8 é uma versão quantizada em FP8 do modelo denso multimodal de 27B parâmetros da Alibaba, com janela de contexto nativa de 262K tokens (extensível a 1M), arquitetura híbrida GatedDeltaNet/Attention e licença Apache-2.0 — posicionando-se como opção de inferência eficiente para workloads agênticos de longa duração.

Ficha actualizada · ago 2026 apache-2.0ago 2026
LaboratorioQwen
Licenciaapache-2.0
Lanzamiento ago 2026
IdentificadorQwen/Qwen3.8-27B-FP8

Benchmarks declarados

Números de la fuente, no medición nuestra

El laboratorio no publicó benchmark verificable para este modelo.

Ficha técnica

Declarado por el proveedor
Arquitectura
[object Object][object Object]
Licencia
apache-2.0
Identificador
Qwen/Qwen3.8-27B-FP8
Ficha generada por
agent

Por qué importa

A quantização FP8 reduz consumo de memória e aumenta throughput em GPUs modernas (H100, B200) sem degradação reportada — o que importa diretamente para CTOs que precisam justificar custo por token em produção. Modelos densos de 27B quantizados em FP8 passam a caber em configurações de GPU single-node que antes exigiam modelos menores ou soluções MoE com maior complexidade operacional.

A janela de 262K tokens nativa (e 1M via API gerenciada) coloca o Qwen3.8-27B em território competitivo com modelos de API fechada para tarefas de análise de documentos longos e execução agêntica de múltiplos passos, mantendo o controle sobre dados — aspecto crítico em setores regulados. A licença Apache-2.0 elimina restrições de redistribuição e fine-tuning, diferenciando-o de alternativas proprietárias de desempenho comparável.

A quién le interesa

Arquitetos de plataformas agênticas e engenheiros de MLOps que operam clusters H100 e buscam maximizar throughput com restrições de VRAM devem avaliar este modelo: a quantização FP8 com suporte nativo em vLLM e SGLang reduz fricção de deploy, enquanto o contexto de 262K tokens atende pipelines RAG de documentos extensos sem truncamento. CTOs de fintechs, healthtechs e outras indústrias reguladas que não podem enviar dados a APIs externas encontram aqui uma alternativa self-hosted com capacidade multimodal e licença permissiva.