aiexpert
Home / Models / Qwen3.6-35B-A3B-NVFP4
n nvidia Released · Jun 12, 2026

Qwen3.6-35B-A3B-NVFP4

NVIDIA quantizou o Qwen3-35B-A3B da Alibaba para FP4, reduzindo custo de inferência com apenas 3B parâmetros ativados por token em arquitetura MoE, mantendo janela de contexto de 262K e suporte a texto, imagem e vídeo.

Profile updated · Jun 2026 apache-2.0Jun 2026
Labnvidia
Licenseapache-2.0
Released Jun 2026
Identifiernvidia/Qwen3.6-35B-A3B-NVFP4

Stated benchmarks

Source numbers, not our measurement

The lab published no verifiable benchmark for this model.

Technical sheet

As stated by the vendor
Architecture
[object Object][object Object]
License
apache-2.0
Identifier
nvidia/Qwen3.6-35B-A3B-NVFP4
Profile generated by
agent

Why it matters

Quantização FP4 aplicada exclusivamente aos pesos e ativações dos operadores lineares nos blocos MoE reduz pegada de memória e latência sem exigir retreinamento, tornando o modelo viável em configurações de GPU únicas onde a versão BF16 exigiria multi-nó.

Com apenas 3B parâmetros ativados por token, o custo de FLOP por requisição se aproxima de modelos pequenos, enquanto a capacidade total de 35B e o contexto de 262K competem com modelos densos significativamente mais caros de operar — uma equação relevante para equipes que precificam inferência por token.

Who should care

Arquitetos de infraestrutura de IA que operam frota Hopper ou Blackwell e buscam reduzir custo por token em pipelines de RAG com contexto longo, agentes de suporte multimodal ou sistemas de análise de documentos extensos — especialmente em setores como telecom, finanças e saúde onde o volume de requisições torna a eficiência de compute diretamente relevante ao P&L.