aiexpert
Home / Models
Profiles generated by the newsroom

Model catalogue

One profile per model: what the lab stated, the benchmarks it published and the coverage the model appeared in. The numbers come from the source — we run no evaluation of our own.

48Models
11Labs
nvidia

parakeet-ctc-1.1b

Parakeet-CTC-1.1B é um modelo FastConformer CTC de 1,1B parâmetros desenvolvido pela NVIDIA e Suno.ai para ASR em inglês, atingindo WER de 1,83% no LibriSpeech clean — referência competitiva para implantação em produção sob licença CC-BY-4.0.

Released Aug 2026 · cc-by-4.0 No benchmark stated
nvidia

nemotron-3.5-asr-streaming-0.6b

NVIDIA lança modelo ASR de 600M parâmetros com arquitetura cache-aware FastConformer-RNNT para transcrição em streaming de baixa latência em 40 localidades de idiomas, com WER de 5,48% no português brasileiro no FLEURS.

Released Aug 2026 · other No benchmark stated
nvidia

NVIDIA-Nemotron-3-Nano-30B-A3B-BF16

Nemotron-3-Nano-30B-A3B-BF16 é um MoE híbrido com apenas 3,5B parâmetros ativos em 30B totais, projetado pela NVIDIA para raciocínio configurável com desempenho superior ao Qwen3-30B-A3B em codificação e provas matemáticas formais.

Released Jul 2026 · other No benchmark stated
nvidia

Qwen3.5-397B-A17B-NVFP4

NVIDIA quantiza o Qwen3.5-397B-A17B da Alibaba para NVFP4, reduzindo footprint de memória com paridade ou ganho mensurável frente à versão FP8 em benchmarks como GPQA Diamond (0.871) e LiveCodeBench V6 (0.843 vs 0.837).

Released Jun 2026 · apache-2.0 No benchmark stated
nvidia

NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4

Nemotron-3-Ultra-550B-A55B é um MoE híbrido de 550B parâmetros totais e 55B ativos, com contexto de 1M tokens e quantização NVFP4 nativa, posicionando a NVIDIA como fornecedora de modelo frontier próprio para workloads agentic de alto custo computacional.

Released Jun 2026 · other No benchmark stated
nvidia

Qwen3.6-35B-A3B-NVFP4

NVIDIA quantizou o Qwen3-35B-A3B da Alibaba para FP4, reduzindo custo de inferência com apenas 3B parâmetros ativados por token em arquitetura MoE, mantendo janela de contexto de 262K e suporte a texto, imagem e vídeo.

Released Jun 2026 · apache-2.0 No benchmark stated
nvidia

diffusiongemma-26B-A4B-it-NVFP4

DiffusionGemma 26B A4B IT quantizado em NVFP4 pela NVIDIA entrega geração de texto via difusão discreta a mais de 1.100 tokens/s em H100, com 3,8B parâmetros ativos em arquitetura MoE e janela de contexto de 256K tokens — combinando custo de inferência de modelo small com capacidade multimodal de modelo large.

Released Jun 2026 · apache-2.0 No benchmark stated
nvidia

Nemotron-Labs-Diffusion-8B-Base

NVIDIA lança Nemotron-Labs-Diffusion-8B-Base, modelo denso tri-modo que combina decodificação autorregressiva, difusão paralela e auto-especulação no mesmo conjunto de pesos, atingindo 850 tok/seg em GB200 — 3,3x acima do AR padrão.

Released Jun 2026 · other No benchmark stated
nvidia

Kimi-K2.5-NVFP4

NVIDIA quantiza o Kimi-K2.5 da Moonshot AI em NVFP4, mantendo benchmarks praticamente intactos (AIME 2025: 96,3 vs. 96,1 de base) e viabilizando inferência do modelo de 1T parâmetros em hardware Blackwell via vLLM.

Released May 2026 · other No benchmark stated
nvidia

Gemma-4-31B-IT-NVFP4

NVIDIA quantiza o Gemma 4 31B do Google em NVFP4 via ModelOpt, mantendo degradação abaixo de 0,5 pp em benchmarks críticos (GPQA Diamond: 85,35%; AIME 2025: 87,60%) e viabilizando inferência multimodal de 256K tokens em hardware Blackwell com vLLM.

Released May 2026 · other No benchmark stated

Where the numbers come from

Every profile keeps the list of sources the numbers came from. No index on this page is produced by us — when the lab does not disclose, the profile says so.

Read the methodology