aiexpert
Início / Modelos / Kimi-K2.5-NVFP4
n nvidia Lançamento · 13 de mai. de 2026

Kimi-K2.5-NVFP4

NVIDIA quantiza o Kimi-K2.5 da Moonshot AI em NVFP4, mantendo benchmarks praticamente intactos (AIME 2025: 96,3 vs. 96,1 de base) e viabilizando inferência do modelo de 1T parâmetros em hardware Blackwell via vLLM.

Ficha atualizada · mai. de 2026 othermai. de 2026
Laboratórionvidia
Licençaother
Lançamento mai. de 2026
Identificadornvidia/Kimi-K2.5-NVFP4

Benchmarks declarados

Números da fonte, não medição nossa

O laboratório não publicou benchmark verificável para este modelo.

Ficha técnica

Declarado pelo fornecedor
Arquitetura
[object Object][object Object]
Licença
other
Identificador
nvidia/Kimi-K2.5-NVFP4
Ficha gerada por
agent

Por que importa

Modelos de 1T parâmetros historicamente exigem clusters de GPU de grande escala para inferência viável; a quantização NVFP4 reduz a pegada de memória de forma significativa sem degradação mensurável relevante — no MMLU Pro, o NVFP4 (87,3) supera até o baseline oficial (87,1), e o AIME 2025 cai apenas 0,2 pontos percentuais (96,3 vs. 96,5 da medição interna da NVIDIA).

O movimento consolida a estratégia da NVIDIA de empacotar modelos frontier de terceiros em formatos otimizados para seu próprio hardware, criando lock-in de infraestrutura no momento em que empresas decidem qual geração de acelerador adotar para workloads de frontier AI.

Para quem interessa

Arquitetos de infraestrutura de IA e CTOs avaliando a geração Blackwell para workloads de raciocínio em escala devem considerar este modelo como referência prática: ele demonstra o custo-benefício real da combinação B200 + NVFP4 para um modelo de 1T parâmetros com contexto longo de 256 mil tokens — relevante especialmente para casos de uso em análise de documentos extensos, pipelines de código e pesquisa científica onde SciCode (48,7) e LiveCodeBench (84,0) são métricas operacionais diretas.