aiexpert
Início / Modelos / NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4
n nvidia Lançamento · 24 de jun. de 2026

NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4

Nemotron-3-Ultra-550B-A55B é um MoE híbrido de 550B parâmetros totais e 55B ativos, com contexto de 1M tokens e quantização NVFP4 nativa, posicionando a NVIDIA como fornecedora de modelo frontier próprio para workloads agentic de alto custo computacional.

Ficha atualizada · jun. de 2026 otherjun. de 2026
Laboratórionvidia
Licençaother
Lançamento jun. de 2026
Identificadornvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4

Benchmarks declarados

Números da fonte, não medição nossa

O laboratório não publicou benchmark verificável para este modelo.

Ficha técnica

Declarado pelo fornecedor
Arquitetura
[object Object][object Object]
Licença
other
Identificador
nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4
Ficha gerada por
agent

Por que importa

A NVIDIA entrega pela primeira vez um modelo frontier próprio treinado nativamente em NVFP4, formalizando uma estratégia vertical que vai da GPU ao peso do modelo — o que cria dependência de ecossistema (hardware Blackwell preferencial) ao mesmo tempo que entrega ganhos mensuráveis de throughput frente a BF16. Nos benchmarks divulgados, a versão NVFP4 iguala ou supera BF16 em várias tarefas agentic: SWE-Bench Multilingual marca 69,1 contra 67,7, e TauBench Telecom atinge 93,6 contra 92,9.

Com 1M de tokens de contexto e raciocínio configurável via parâmetro no chat template, o modelo endereça diretamente dois gargalos recorrentes em deployments enterprise: janelas curtas em pipelines de RAG extenso e a necessidade de alternar entre modo analítico e conversacional sem trocar de modelo.

Para quem interessa

Arquitetos de sistemas agentic e RAG em empresas com infraestrutura NVIDIA Blackwell/Hopper devem avaliar o modelo imediatamente para pipelines de análise de documentos longos, automação de código multilíngue e agentes de atendimento — especialmente porque o SWE-Bench Verified em 69,5% (NVFP4) e o TauBench em setores como Telecom (93,6%) indicam maturidade para tarefas de produção, não apenas benchmarking. CTOs em mercados regulados devem atentar para os termos OpenMDW-1.1 antes de qualquer deploy em dados sensíveis.