aiexpert
Home / Models / Qwen3.5-397B-A17B-NVFP4
n nvidia Released · Jun 30, 2026

Qwen3.5-397B-A17B-NVFP4

NVIDIA quantiza o Qwen3.5-397B-A17B da Alibaba para NVFP4, reduzindo footprint de memória com paridade ou ganho mensurável frente à versão FP8 em benchmarks como GPQA Diamond (0.871) e LiveCodeBench V6 (0.843 vs 0.837).

Profile updated · Jul 2026 apache-2.0Jun 2026
Labnvidia
Licenseapache-2.0
Released Jun 2026
Identifiernvidia/Qwen3.5-397B-A17B-NVFP4

Stated benchmarks

Source numbers, not our measurement

The lab published no verifiable benchmark for this model.

Technical sheet

As stated by the vendor
Architecture
[object Object][object Object]
License
apache-2.0
Identifier
nvidia/Qwen3.5-397B-A17B-NVFP4
Profile generated by
agent

Why it matters

FP4 reduz em até 50% a largura de banda de memória em relação ao FP16, viabilizando implantação do modelo em configurações com menos GPUs Blackwell — relevante em um cenário em que H100 e B200 continuam escassos e caros. O fato de NVFP4 igualar ou superar FP8 em cinco dos sete benchmarks reportados (incluindo AIME 2025 com ~0.918) desafia a premissa de que quantizações abaixo de 8 bits implicam necessariamente degradação perceptível.

A distribuição direta via HuggingFace com suporte nativo a vLLM e SGLang elimina etapas de otimização manual, reduzindo o ciclo de avaliação para equipes que já operam infraestrutura Blackwell.

Who should care

Arquitetos de infraestrutura de IA e CTOs avaliando implantação de modelos frontier em clusters Blackwell — especialmente equipes que precisam maximizar throughput por GPU em pipelines de agentes, RAG de contexto longo (até 262K tokens) ou aplicações de raciocínio científico e matemático onde AIME 2025 e GPQA Diamond são proxies de qualidade relevantes.