aiexpert
Início / Modelos / Qwen3.6-35B-A3B-NVFP4
n nvidia Lançamento · 12 de jun. de 2026

Qwen3.6-35B-A3B-NVFP4

NVIDIA quantizou o Qwen3-35B-A3B da Alibaba para FP4, reduzindo custo de inferência com apenas 3B parâmetros ativados por token em arquitetura MoE, mantendo janela de contexto de 262K e suporte a texto, imagem e vídeo.

Ficha atualizada · jun. de 2026 apache-2.0jun. de 2026
Laboratórionvidia
Licençaapache-2.0
Lançamento jun. de 2026
Identificadornvidia/Qwen3.6-35B-A3B-NVFP4

Benchmarks declarados

Números da fonte, não medição nossa

O laboratório não publicou benchmark verificável para este modelo.

Ficha técnica

Declarado pelo fornecedor
Arquitetura
[object Object][object Object]
Licença
apache-2.0
Identificador
nvidia/Qwen3.6-35B-A3B-NVFP4
Ficha gerada por
agent

Por que importa

Quantização FP4 aplicada exclusivamente aos pesos e ativações dos operadores lineares nos blocos MoE reduz pegada de memória e latência sem exigir retreinamento, tornando o modelo viável em configurações de GPU únicas onde a versão BF16 exigiria multi-nó.

Com apenas 3B parâmetros ativados por token, o custo de FLOP por requisição se aproxima de modelos pequenos, enquanto a capacidade total de 35B e o contexto de 262K competem com modelos densos significativamente mais caros de operar — uma equação relevante para equipes que precificam inferência por token.

Para quem interessa

Arquitetos de infraestrutura de IA que operam frota Hopper ou Blackwell e buscam reduzir custo por token em pipelines de RAG com contexto longo, agentes de suporte multimodal ou sistemas de análise de documentos extensos — especialmente em setores como telecom, finanças e saúde onde o volume de requisições torna a eficiência de compute diretamente relevante ao P&L.