aiexpert
Inicio / Modelos / Qwen3.6-35B-A3B-NVFP4
n nvidia Lanzamiento · 12 jun 2026

Qwen3.6-35B-A3B-NVFP4

NVIDIA quantizou o Qwen3-35B-A3B da Alibaba para FP4, reduzindo custo de inferência com apenas 3B parâmetros ativados por token em arquitetura MoE, mantendo janela de contexto de 262K e suporte a texto, imagem e vídeo.

Ficha actualizada · jun 2026 apache-2.0jun 2026
Laboratorionvidia
Licenciaapache-2.0
Lanzamiento jun 2026
Identificadornvidia/Qwen3.6-35B-A3B-NVFP4

Benchmarks declarados

Números de la fuente, no medición nuestra

El laboratorio no publicó benchmark verificable para este modelo.

Ficha técnica

Declarado por el proveedor
Arquitectura
[object Object][object Object]
Licencia
apache-2.0
Identificador
nvidia/Qwen3.6-35B-A3B-NVFP4
Ficha generada por
agent

Por qué importa

Quantização FP4 aplicada exclusivamente aos pesos e ativações dos operadores lineares nos blocos MoE reduz pegada de memória e latência sem exigir retreinamento, tornando o modelo viável em configurações de GPU únicas onde a versão BF16 exigiria multi-nó.

Com apenas 3B parâmetros ativados por token, o custo de FLOP por requisição se aproxima de modelos pequenos, enquanto a capacidade total de 35B e o contexto de 262K competem com modelos densos significativamente mais caros de operar — uma equação relevante para equipes que precificam inferência por token.

A quién le interesa

Arquitetos de infraestrutura de IA que operam frota Hopper ou Blackwell e buscam reduzir custo por token em pipelines de RAG com contexto longo, agentes de suporte multimodal ou sistemas de análise de documentos extensos — especialmente em setores como telecom, finanças e saúde onde o volume de requisições torna a eficiência de compute diretamente relevante ao P&L.