aiexpert
Home / Models
Profiles generated by the newsroom

Model catalogue

One profile per model: what the lab stated, the benchmarks it published and the coverage the model appeared in. The numbers come from the source — we run no evaluation of our own.

48Models
11Labs
nvidia

parakeet-ctc-1.1b

Parakeet-CTC-1.1B é um modelo FastConformer CTC de 1,1B parâmetros desenvolvido pela NVIDIA e Suno.ai para ASR em inglês, atingindo WER de 1,83% no LibriSpeech clean — referência competitiva para implantação em produção sob licença CC-BY-4.0.

Released Aug 2026 · cc-by-4.0 No benchmark stated
nvidia

nemotron-3.5-asr-streaming-0.6b

NVIDIA lança modelo ASR de 600M parâmetros com arquitetura cache-aware FastConformer-RNNT para transcrição em streaming de baixa latência em 40 localidades de idiomas, com WER de 5,48% no português brasileiro no FLEURS.

Released Aug 2026 · other No benchmark stated
nvidia

NVIDIA-Nemotron-3-Nano-30B-A3B-BF16

Nemotron-3-Nano-30B-A3B-BF16 é um MoE híbrido com apenas 3,5B parâmetros ativos em 30B totais, projetado pela NVIDIA para raciocínio configurável com desempenho superior ao Qwen3-30B-A3B em codificação e provas matemáticas formais.

Released Jul 2026 · other No benchmark stated
microsoft

phi-4

Phi-4 é um modelo denso de 14B parâmetros da Microsoft, treinado com 9,8T tokens de dados sintéticos e curados de alta qualidade, projetado para raciocínio avançado em ambientes com restrições de memória e latência — licença MIT.

Released Jul 2026 · mit No benchmark stated
google

gemma-4-E2B-it-qat-w4a16-ct

Google lança variante QAT w4a16 do Gemma 4 E2B em formato Compressed Tensors, preservando qualidade bfloat16 com footprint de memória drasticamente reduzido para inferência nativa no vLLM — aposta direta em edge e GPU de consumidor.

Released Jul 2026 · apache-2.0 No benchmark stated
deepseek-ai

DeepSeek-V4-Flash-DSpark

DeepSeek-V4-Flash-DSpark é o checkpoint DeepSeek-V4-Flash (284B parâmetros, 13B ativados, contexto de 1M tokens) com um módulo de decodificação especulativa acoplado, licença MIT, sem alterações nos pesos do modelo base.

Released Jul 2026 · mit No benchmark stated
mistralai

Ministral-3-3B-Instruct-2512

Ministral 3 3B Instruct 2512 é um modelo multimodal de 3,4B parâmetros (+ encoder de visão de 0,4B) da Mistral, com janela de contexto de 256k tokens, licença Apache 2.0 e footprint de 8GB VRAM em FP8 — posicionado para inferência de borda com visão nativa e function calling.

Released Jun 2026 · apache-2.0 No benchmark stated
mistralai

Devstral-Small-2-24B-Instruct-2512

Devstral Small 2 é um LLM de engenharia de software de 24B parâmetros com janela de 256k tokens, licença Apache 2.0 e score de 68% no SWE-bench Verified — equiparando modelos proprietários muito maiores a uma fração do custo computacional.

Released Jun 2026 · apache-2.0 No benchmark stated
nvidia

Qwen3.5-397B-A17B-NVFP4

NVIDIA quantiza o Qwen3.5-397B-A17B da Alibaba para NVFP4, reduzindo footprint de memória com paridade ou ganho mensurável frente à versão FP8 em benchmarks como GPQA Diamond (0.871) e LiveCodeBench V6 (0.843 vs 0.837).

Released Jun 2026 · apache-2.0 No benchmark stated
nvidia

NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4

Nemotron-3-Ultra-550B-A55B é um MoE híbrido de 550B parâmetros totais e 55B ativos, com contexto de 1M tokens e quantização NVFP4 nativa, posicionando a NVIDIA como fornecedora de modelo frontier próprio para workloads agentic de alto custo computacional.

Released Jun 2026 · other No benchmark stated

Claude Opus 4.8

Claude Opus 4.8 reposiciona a Anthropic no segmento de agentes autônomos com redução de preço de dois terços e GPQA-Diamond de 93,6%, tornando raciocínio de nível especialista economicamente viável em pipelines de produção.

93.6 GPQA-Diamond
Profile from Jun 2026 1 benchmark

Claude Fable 5

Claude Fable 5 é o modelo mais capaz da Anthropic em benchmarks científicos (GPQA-Diamond 94,1%), mas seu acesso foi suspenso por intervenção governamental dos EUA, tornando-o um ativo estratégico sob controle regulatório direto.

94.1 GPQA-Diamond
Profile from Jun 2026 1 benchmark
nvidia

Qwen3.6-35B-A3B-NVFP4

NVIDIA quantizou o Qwen3-35B-A3B da Alibaba para FP4, reduzindo custo de inferência com apenas 3B parâmetros ativados por token em arquitetura MoE, mantendo janela de contexto de 262K e suporte a texto, imagem e vídeo.

Released Jun 2026 · apache-2.0 No benchmark stated
nvidia

diffusiongemma-26B-A4B-it-NVFP4

DiffusionGemma 26B A4B IT quantizado em NVFP4 pela NVIDIA entrega geração de texto via difusão discreta a mais de 1.100 tokens/s em H100, com 3,8B parâmetros ativos em arquitetura MoE e janela de contexto de 256K tokens — combinando custo de inferência de modelo small com capacidade multimodal de modelo large.

Released Jun 2026 · apache-2.0 No benchmark stated
google

diffusiongemma-26B-A4B-it

DiffusionGemma 26B A4B é um modelo multimodal MoE da Google DeepMind que substitui autogressão token-a-token por difusão discreta em blocos, atingindo mais de 1.100 tokens/s em H100 FP8 — com tradeoff mensurável de qualidade frente ao Gemma 4 base.

Released Jun 2026 · apache-2.0 No benchmark stated
google

gemma-4-12B-it-qat-w4a16-ct

Google lança Gemma 4 12B em formato QAT w4a16 via compressed-tensors, viabilizando inferência otimizada no vLLM com qualidade próxima ao bfloat16 e janela de contexto de 256K tokens sob licença Apache 2.0.

Released Jun 2026 · apache-2.0 No benchmark stated
google

gemma-4-31B-it-qat-w4a16-ct

Google DeepMind lança versão quantizada com QAT do Gemma 4 31B denso em formato compressed-tensors w4a16, permitindo inferência nativa no vLLM com qualidade próxima ao bfloat16 e footprint de memória drasticamente reduzido — relevante para equipes que precisam rodar 31B parâmetros em hardware de workstation.

Released Jun 2026 · apache-2.0 No benchmark stated
nvidia

Nemotron-Labs-Diffusion-8B-Base

NVIDIA lança Nemotron-Labs-Diffusion-8B-Base, modelo denso tri-modo que combina decodificação autorregressiva, difusão paralela e auto-especulação no mesmo conjunto de pesos, atingindo 850 tok/seg em GB200 — 3,3x acima do AR padrão.

Released Jun 2026 · other No benchmark stated
CohereLabs

cohere-transcribe-03-2026

Cohere lança modelo de transcrição sob licença Apache 2.0 em maio de 2026, mas a ausência de documentação pública impede avaliação técnica independente no momento.

Released May 2026 · apache-2.0 No benchmark stated
ibm-granite

granite-speech-4.1-2b

IBM lança Granite Speech 4.1 2B, modelo compacto de fala com 2B parâmetros, suporte a ASR e tradução bidirecional em 6 idiomas, treinado com 174 mil horas de áudio, sob licença Apache 2.0.

Released May 2026 · apache-2.0 No benchmark stated
ibm-granite

granite-embedding-311m-multilingual-r2

IBM lança modelo de embeddings multilíngue de 311M parâmetros com arquitetura ModernBERT, janela de 32k tokens e ganho de +14,5 pontos em benchmarks MTEB frente à geração anterior — licença Apache 2.0 viabiliza adoção corporativa irrestrita.

Released May 2026 · apache-2.0 No benchmark stated
nvidia

Kimi-K2.5-NVFP4

NVIDIA quantiza o Kimi-K2.5 da Moonshot AI em NVFP4, mantendo benchmarks praticamente intactos (AIME 2025: 96,3 vs. 96,1 de base) e viabilizando inferência do modelo de 1T parâmetros em hardware Blackwell via vLLM.

Released May 2026 · other No benchmark stated
microsoft

rad-dino

RAD-DINO é um Vision Transformer ViT-B/14 da Microsoft treinado com autossupervisão (DINOv2) em 882 mil radiografias de tórax, entregando embeddings de imagem médica sem necessidade de supervisão textual.

Released May 2026 No benchmark stated

Claude Opus 4.7 (1M context)

Claude Opus 4.7 com janela de 1M tokens entrega 94,2% no GPQA-Diamond e arquitetura subquadrática SubQ, posicionando-se como opção viável para raciocínio científico em escala documental sem custo quadrático de atenção.

94.2 GPQA-Diamond
Profile from May 2026 1 benchmark

Gemini 3.5 Pro

Gemini 3.5 Pro registra 94,3% no GPQA-Diamond, benchmark de raciocínio científico de nível especialista, mas detalhes de arquitetura e disponibilidade ainda não foram divulgados publicamente pelo Google.

94.3 GPQA-Diamond
Profile from May 2026 1 benchmark
nvidia

Gemma-4-31B-IT-NVFP4

NVIDIA quantiza o Gemma 4 31B do Google em NVFP4 via ModelOpt, mantendo degradação abaixo de 0,5 pp em benchmarks críticos (GPQA Diamond: 85,35%; AIME 2025: 87,60%) e viabilizando inferência multimodal de 256K tokens em hardware Blackwell com vLLM.

Released May 2026 · other No benchmark stated
google

gemma-4-E2B-it

Gemma 4 E2B é um modelo denso multimodal de 2,3B parâmetros efetivos (5,1B com embeddings) da Google DeepMind, licenciado em Apache 2.0, com suporte a texto, imagem e áudio em janela de contexto de 128K tokens — posicionado para inferência local em dispositivos móveis e laptops.

Released May 2026 · apache-2.0 No benchmark stated
google

gemma-4-E4B-it

Gemma 4 E4B é um modelo denso multimodal de 4,5B parâmetros efetivos (8B com embeddings) da Google DeepMind, licenciado em Apache 2.0, com janela de contexto de 128K tokens e suporte nativo a texto, imagem e áudio — projetado para execução local em laptops e dispositivos móveis.

Released May 2026 · apache-2.0 No benchmark stated
google

gemma-4-26B-A4B-it

Gemma 4 26B A4B é um modelo MoE multimodal do Google DeepMind com 25,2B parâmetros totais e apenas 3,8B ativos por inferência, janela de 256K tokens e licença Apache 2.0 — entregando desempenho próximo ao 31B denso com custo computacional de um modelo 4B.

Released May 2026 · apache-2.0 No benchmark stated
google

gemma-4-31B-it

Gemma 4 31B é um modelo denso multimodal de 30,7B parâmetros, Apache 2.0, com janela de 256K tokens e 89,2% no AIME 2026 sem ferramentas — desempenho de raciocínio que rivaliza com modelos proprietários de maior escala.

Released May 2026 · apache-2.0 No benchmark stated
deepseek-ai

DeepSeek-V4-Pro

DeepSeek-V4-Pro é um MoE de 1,6T parâmetros (49B ativados) com janela de 1M tokens e licença MIT que reduz FLOPs de inferência em 73% frente ao V3.2, posicionando-se como o modelo open-source de maior contexto e eficiência computacional disponível hoje.

Released May 2026 · mit No benchmark stated
deepseek-ai

DeepSeek-V4-Flash

DeepSeek-V4-Flash é um MoE de 284B parâmetros (13B ativados) com janela de 1 milhão de tokens e licença MIT, posicionado como alternativa de baixo custo computacional ao V4-Pro para implantações auto-hospedadas de longo contexto.

Released May 2026 · mit No benchmark stated
ibm-granite

granite-4.1-8b

IBM lança Granite-4.1-8B, modelo instruct de 8B parâmetros com contexto longo, licença Apache 2.0 e capacidades aprimoradas de tool calling e RAG — posicionado como base para agentes empresariais em 12 idiomas.

Released May 2026 · apache-2.0 No benchmark stated
mistralai

Mistral-Medium-3.5-128B

Mistral Medium 3.5 é um modelo denso de 128B parâmetros com janela de 256k tokens, visão nativa e raciocínio configurável por requisição — unificando em um único conjunto de pesos o que antes exigia modelos separados (Medium 3.1, Magistral, Devstral 2).

Released May 2026 · other No benchmark stated

Gemini 3 Pro

Gemini 3 Pro registra 91,9% no GPQA-Diamond, posicionando-se entre os modelos de fronteira em raciocínio científico, mas detalhes arquiteturais oficiais ainda não foram divulgados pelo Google.

91.9 GPQA-Diamond
Profile from May 2026 1 benchmark

GPT-5.2

GPT-5.2 é um modelo intermediário da OpenAI com 92,4% no GPQA-Diamond, posicionado entre gerações da família GPT-5 em um momento em que a empresa pressiona por migração de prompts legados.

92.4 GPQA-Diamond
Profile from May 2026 1 benchmark

Gemini 3.1 Pro

Gemini 3.1 Pro registra 94,1% no GPQA-Diamond, mas ausência de ficha técnica pública impede avaliação arquitetural independente — posicionamento no mercado depende inteiramente de divulgação do Google.

94.1 GPQA-Diamond
Profile from May 2026 1 benchmark
ibm-granite

granitelib-guardian-r1.0

IBM lança quatro adaptadores LoRA sobre o Granite 4.0 Micro para guardrails de segurança, detecção e correção de alucinações e verificação de conformidade com políticas — sob licença Apache-2.0.

Released May 2026 · apache-2.0 No benchmark stated
ibm-granite

granitelib-core-r1.0

IBM lança três adaptadores LoRA sobre o Granite 4.0 Micro que adicionam atribuição de contexto, verificação de requisitos e pontuação de incerteza calibrada — funcionalidades de explicabilidade e auditoria sem custo de fine-tuning completo.

Released May 2026 · apache-2.0 No benchmark stated
CohereLabs

tiny-aya-base

tiny-aya-base é um modelo de linguagem multilíngue compacto da Cohere Labs, lançado sob licença não-comercial CC-BY-NC-4.0, posicionado para pesquisa em idiomas de baixos recursos com footprint computacional reduzido.

Released May 2026 · cc-by-nc-4.0 No benchmark stated
CohereLabs

tiny-aya-fire

tiny-aya-fire é um modelo compacto multilíngue da Cohere Labs, lançado em maio de 2026 sob licença CC-BY-NC-4.0, com detalhes técnicos ainda não divulgados publicamente.

Released May 2026 · cc-by-nc-4.0 No benchmark stated
CohereLabs

tiny-aya-global

Tiny-aya-global é um modelo multilíngue compacto da CohereLabs lançado em maio de 2026 sob licença CC-BY-NC-4.0, posicionado para inferência de baixo custo em cenários globais — mas detalhes técnicos públicos ainda são escassos.

Released May 2026 · cc-by-nc-4.0 No benchmark stated
NVIDIA

NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4

NVIDIA's 120B sparse MoE with 12B active parameters, shipped at NVFP4 4-bit precision so it inferences on a single H200 — the most aggressive cost-per-token cut from a frontier-tier open weight model this quarter.

88.4 GPQA-Diamond 81.7 MMLU-Pro
Released May 2026 · NVIDIA Open Model License 2 benchmarks
Qwen

Qwen3.5-122B-A10B-FP8

Qwen3.5-122B-A10B-FP8 é uma MoE multimodal de 122B parâmetros totais (10B ativos) com arquitetura híbrida Gated DeltaNet + atenção esparsa, contexto nativo de 262K tokens e quantização FP8, sob licença Apache-2.0.

Released Apr 2026 · apache-2.0 No benchmark stated
OpenAI

GPT-5.5

OpenAI's flagship reasoning model — third on GPQA-Diamond at 93.5 — and the model behind the recent enterprise pricing reset (2× per-token vs GPT-5.4) plus the Codex CLI subscription bundle.

93.5 GPQA-Diamond
Released Apr 2026 · Proprietary (OpenAI API) 1 benchmark
google

gemma-4-E2B

Gemma 4 E2B é um modelo denso multimodal de 2,3B parâmetros efetivos (5,1B com embeddings) da Google DeepMind, licenciado sob Apache 2.0, otimizado para execução local em dispositivos móveis e laptops com suporte a texto, imagem e áudio em janela de contexto de 128K tokens.

Released Apr 2026 · apache-2.0 No benchmark stated
Anthropic

Claude Opus 4.7

Anthropic's flagship reasoning model — currently #1 on GPQA-Diamond at 94.2 — and the model that anchors the Managed Agents API + Claude Code routines that operator-grade workflows depend on.

94.2 GPQA-Diamond
Released Mar 2026 · Proprietary (Anthropic API) 1 benchmark
mistralai

Voxtral-Mini-4B-Realtime-2602

Voxtral Mini 4B Realtime é o primeiro modelo open-source de transcrição de voz em streaming a atingir WER médio de 8,72% a 480ms de latência — paridade prática com sistemas offline — sob licença Apache-2.0.

Released Mar 2026 · apache-2.0 No benchmark stated

Where the numbers come from

Every profile keeps the list of sources the numbers came from. No index on this page is produced by us — when the lab does not disclose, the profile says so.

Read the methodology