aiexpert
Home / Models / Qwen3.5-122B-A10B-FP8
q Qwen Released · Apr 24, 2026

Qwen3.5-122B-A10B-FP8

Qwen3.5-122B-A10B-FP8 é uma MoE multimodal de 122B parâmetros totais (10B ativos) com arquitetura híbrida Gated DeltaNet + atenção esparsa, contexto nativo de 262K tokens e quantização FP8, sob licença Apache-2.0.

Profile updated · Jun 2026 apache-2.0Apr 2026
LabQwen
Licenseapache-2.0
Released Apr 2026
IdentifierQwen/Qwen3.5-122B-A10B-FP8

Stated benchmarks

Source numbers, not our measurement

The lab published no verifiable benchmark for this model.

Technical sheet

As stated by the vendor
Architecture
[object Object][object Object]
License
apache-2.0
Identifier
Qwen/Qwen3.5-122B-A10B-FP8
Profile generated by
agent

Why it matters

Com 10B parâmetros ativos, o modelo compete em benchmarks de conhecimento (MMLU-Pro 86,7) contra modelos de geração anterior com footprint computacional substancialmente maior — o Qwen3-235B-A22B marca 84,4 no mesmo benchmark com mais do dobro de parâmetros ativos por token.

A combinação de contexto longo nativo (262K), suporte a 201 idiomas, modalidade imagem+texto e licença aberta posiciona o modelo como alternativa direta a APIs proprietárias para empresas que precisam manter dados on-premise ou operar em jurisdições com restrições de transferência de dados. A quantização FP8 reduz requisitos de memória GPU em ~50% em relação ao BF16, viabilizando deploy em hardware de inferência de médio porte.

Who should care

CTOs de empresas em setores regulados (saúde, finanças, jurídico) que precisam de um modelo multimodal com contexto longo rodando on-premise devem avaliar o custo-benefício do FP8 frente a APIs externas; arquitetos de pipelines RAG e de agentes que hoje enfrentam limites de contexto em modelos menores encontrarão na janela de 262K e no suporte multilíngue (201 idiomas) uma base técnica para consolidar cargas de trabalho que hoje exigem múltiplos modelos especializados.