aiexpert
Início / Modelos / Qwen3.5-122B-A10B-FP8
q Qwen Lançamento · 24 de abr. de 2026

Qwen3.5-122B-A10B-FP8

Qwen3.5-122B-A10B-FP8 é uma MoE multimodal de 122B parâmetros totais (10B ativos) com arquitetura híbrida Gated DeltaNet + atenção esparsa, contexto nativo de 262K tokens e quantização FP8, sob licença Apache-2.0.

Ficha atualizada · jun. de 2026 apache-2.0abr. de 2026
LaboratórioQwen
Licençaapache-2.0
Lançamento abr. de 2026
IdentificadorQwen/Qwen3.5-122B-A10B-FP8

Benchmarks declarados

Números da fonte, não medição nossa

O laboratório não publicou benchmark verificável para este modelo.

Ficha técnica

Declarado pelo fornecedor
Arquitetura
[object Object][object Object]
Licença
apache-2.0
Identificador
Qwen/Qwen3.5-122B-A10B-FP8
Ficha gerada por
agent

Por que importa

Com 10B parâmetros ativos, o modelo compete em benchmarks de conhecimento (MMLU-Pro 86,7) contra modelos de geração anterior com footprint computacional substancialmente maior — o Qwen3-235B-A22B marca 84,4 no mesmo benchmark com mais do dobro de parâmetros ativos por token.

A combinação de contexto longo nativo (262K), suporte a 201 idiomas, modalidade imagem+texto e licença aberta posiciona o modelo como alternativa direta a APIs proprietárias para empresas que precisam manter dados on-premise ou operar em jurisdições com restrições de transferência de dados. A quantização FP8 reduz requisitos de memória GPU em ~50% em relação ao BF16, viabilizando deploy em hardware de inferência de médio porte.

Para quem interessa

CTOs de empresas em setores regulados (saúde, finanças, jurídico) que precisam de um modelo multimodal com contexto longo rodando on-premise devem avaliar o custo-benefício do FP8 frente a APIs externas; arquitetos de pipelines RAG e de agentes que hoje enfrentam limites de contexto em modelos menores encontrarão na janela de 262K e no suporte multilíngue (201 idiomas) uma base técnica para consolidar cargas de trabalho que hoje exigem múltiplos modelos especializados.