aiexpert
Inicio / Modelos
Fichas generadas por la redacción

Catálogo de modelos

Una ficha por modelo: lo que el laboratorio declaró, los benchmarks que publicó y la cobertura en que apareció. Los números son de la fuente — no hacemos evaluación propia.

48Modelos
11Laboratorios
nvidia

parakeet-ctc-1.1b

Parakeet-CTC-1.1B é um modelo FastConformer CTC de 1,1B parâmetros desenvolvido pela NVIDIA e Suno.ai para ASR em inglês, atingindo WER de 1,83% no LibriSpeech clean — referência competitiva para implantação em produção sob licença CC-BY-4.0.

Lanzado ago 2026 · cc-by-4.0 Sin benchmark declarado
nvidia

nemotron-3.5-asr-streaming-0.6b

NVIDIA lança modelo ASR de 600M parâmetros com arquitetura cache-aware FastConformer-RNNT para transcrição em streaming de baixa latência em 40 localidades de idiomas, com WER de 5,48% no português brasileiro no FLEURS.

Lanzado ago 2026 · other Sin benchmark declarado
nvidia

NVIDIA-Nemotron-3-Nano-30B-A3B-BF16

Nemotron-3-Nano-30B-A3B-BF16 é um MoE híbrido com apenas 3,5B parâmetros ativos em 30B totais, projetado pela NVIDIA para raciocínio configurável com desempenho superior ao Qwen3-30B-A3B em codificação e provas matemáticas formais.

Lanzado jul 2026 · other Sin benchmark declarado
microsoft

phi-4

Phi-4 é um modelo denso de 14B parâmetros da Microsoft, treinado com 9,8T tokens de dados sintéticos e curados de alta qualidade, projetado para raciocínio avançado em ambientes com restrições de memória e latência — licença MIT.

Lanzado jul 2026 · mit Sin benchmark declarado
google

gemma-4-E2B-it-qat-w4a16-ct

Google lança variante QAT w4a16 do Gemma 4 E2B em formato Compressed Tensors, preservando qualidade bfloat16 com footprint de memória drasticamente reduzido para inferência nativa no vLLM — aposta direta em edge e GPU de consumidor.

Lanzado jul 2026 · apache-2.0 Sin benchmark declarado
deepseek-ai

DeepSeek-V4-Flash-DSpark

DeepSeek-V4-Flash-DSpark é o checkpoint DeepSeek-V4-Flash (284B parâmetros, 13B ativados, contexto de 1M tokens) com um módulo de decodificação especulativa acoplado, licença MIT, sem alterações nos pesos do modelo base.

Lanzado jul 2026 · mit Sin benchmark declarado
mistralai

Ministral-3-3B-Instruct-2512

Ministral 3 3B Instruct 2512 é um modelo multimodal de 3,4B parâmetros (+ encoder de visão de 0,4B) da Mistral, com janela de contexto de 256k tokens, licença Apache 2.0 e footprint de 8GB VRAM em FP8 — posicionado para inferência de borda com visão nativa e function calling.

Lanzado jun 2026 · apache-2.0 Sin benchmark declarado
mistralai

Devstral-Small-2-24B-Instruct-2512

Devstral Small 2 é um LLM de engenharia de software de 24B parâmetros com janela de 256k tokens, licença Apache 2.0 e score de 68% no SWE-bench Verified — equiparando modelos proprietários muito maiores a uma fração do custo computacional.

Lanzado jun 2026 · apache-2.0 Sin benchmark declarado
nvidia

Qwen3.5-397B-A17B-NVFP4

NVIDIA quantiza o Qwen3.5-397B-A17B da Alibaba para NVFP4, reduzindo footprint de memória com paridade ou ganho mensurável frente à versão FP8 em benchmarks como GPQA Diamond (0.871) e LiveCodeBench V6 (0.843 vs 0.837).

Lanzado jun 2026 · apache-2.0 Sin benchmark declarado
nvidia

NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4

Nemotron-3-Ultra-550B-A55B é um MoE híbrido de 550B parâmetros totais e 55B ativos, com contexto de 1M tokens e quantização NVFP4 nativa, posicionando a NVIDIA como fornecedora de modelo frontier próprio para workloads agentic de alto custo computacional.

Lanzado jun 2026 · other Sin benchmark declarado

Claude Opus 4.8

Claude Opus 4.8 reposiciona a Anthropic no segmento de agentes autônomos com redução de preço de dois terços e GPQA-Diamond de 93,6%, tornando raciocínio de nível especialista economicamente viável em pipelines de produção.

93.6 GPQA-Diamond
Ficha de jun 2026 1 benchmark

Claude Fable 5

Claude Fable 5 é o modelo mais capaz da Anthropic em benchmarks científicos (GPQA-Diamond 94,1%), mas seu acesso foi suspenso por intervenção governamental dos EUA, tornando-o um ativo estratégico sob controle regulatório direto.

94.1 GPQA-Diamond
Ficha de jun 2026 1 benchmark
nvidia

Qwen3.6-35B-A3B-NVFP4

NVIDIA quantizou o Qwen3-35B-A3B da Alibaba para FP4, reduzindo custo de inferência com apenas 3B parâmetros ativados por token em arquitetura MoE, mantendo janela de contexto de 262K e suporte a texto, imagem e vídeo.

Lanzado jun 2026 · apache-2.0 Sin benchmark declarado
nvidia

diffusiongemma-26B-A4B-it-NVFP4

DiffusionGemma 26B A4B IT quantizado em NVFP4 pela NVIDIA entrega geração de texto via difusão discreta a mais de 1.100 tokens/s em H100, com 3,8B parâmetros ativos em arquitetura MoE e janela de contexto de 256K tokens — combinando custo de inferência de modelo small com capacidade multimodal de modelo large.

Lanzado jun 2026 · apache-2.0 Sin benchmark declarado
google

diffusiongemma-26B-A4B-it

DiffusionGemma 26B A4B é um modelo multimodal MoE da Google DeepMind que substitui autogressão token-a-token por difusão discreta em blocos, atingindo mais de 1.100 tokens/s em H100 FP8 — com tradeoff mensurável de qualidade frente ao Gemma 4 base.

Lanzado jun 2026 · apache-2.0 Sin benchmark declarado
google

gemma-4-12B-it-qat-w4a16-ct

Google lança Gemma 4 12B em formato QAT w4a16 via compressed-tensors, viabilizando inferência otimizada no vLLM com qualidade próxima ao bfloat16 e janela de contexto de 256K tokens sob licença Apache 2.0.

Lanzado jun 2026 · apache-2.0 Sin benchmark declarado
google

gemma-4-31B-it-qat-w4a16-ct

Google DeepMind lança versão quantizada com QAT do Gemma 4 31B denso em formato compressed-tensors w4a16, permitindo inferência nativa no vLLM com qualidade próxima ao bfloat16 e footprint de memória drasticamente reduzido — relevante para equipes que precisam rodar 31B parâmetros em hardware de workstation.

Lanzado jun 2026 · apache-2.0 Sin benchmark declarado
nvidia

Nemotron-Labs-Diffusion-8B-Base

NVIDIA lança Nemotron-Labs-Diffusion-8B-Base, modelo denso tri-modo que combina decodificação autorregressiva, difusão paralela e auto-especulação no mesmo conjunto de pesos, atingindo 850 tok/seg em GB200 — 3,3x acima do AR padrão.

Lanzado jun 2026 · other Sin benchmark declarado
CohereLabs

cohere-transcribe-03-2026

Cohere lança modelo de transcrição sob licença Apache 2.0 em maio de 2026, mas a ausência de documentação pública impede avaliação técnica independente no momento.

Lanzado may 2026 · apache-2.0 Sin benchmark declarado
ibm-granite

granite-speech-4.1-2b

IBM lança Granite Speech 4.1 2B, modelo compacto de fala com 2B parâmetros, suporte a ASR e tradução bidirecional em 6 idiomas, treinado com 174 mil horas de áudio, sob licença Apache 2.0.

Lanzado may 2026 · apache-2.0 Sin benchmark declarado
ibm-granite

granite-embedding-311m-multilingual-r2

IBM lança modelo de embeddings multilíngue de 311M parâmetros com arquitetura ModernBERT, janela de 32k tokens e ganho de +14,5 pontos em benchmarks MTEB frente à geração anterior — licença Apache 2.0 viabiliza adoção corporativa irrestrita.

Lanzado may 2026 · apache-2.0 Sin benchmark declarado
nvidia

Kimi-K2.5-NVFP4

NVIDIA quantiza o Kimi-K2.5 da Moonshot AI em NVFP4, mantendo benchmarks praticamente intactos (AIME 2025: 96,3 vs. 96,1 de base) e viabilizando inferência do modelo de 1T parâmetros em hardware Blackwell via vLLM.

Lanzado may 2026 · other Sin benchmark declarado
microsoft

rad-dino

RAD-DINO é um Vision Transformer ViT-B/14 da Microsoft treinado com autossupervisão (DINOv2) em 882 mil radiografias de tórax, entregando embeddings de imagem médica sem necessidade de supervisão textual.

Lanzado may 2026 Sin benchmark declarado

Claude Opus 4.7 (1M context)

Claude Opus 4.7 com janela de 1M tokens entrega 94,2% no GPQA-Diamond e arquitetura subquadrática SubQ, posicionando-se como opção viável para raciocínio científico em escala documental sem custo quadrático de atenção.

94.2 GPQA-Diamond
Ficha de may 2026 1 benchmark

Gemini 3.5 Pro

Gemini 3.5 Pro registra 94,3% no GPQA-Diamond, benchmark de raciocínio científico de nível especialista, mas detalhes de arquitetura e disponibilidade ainda não foram divulgados publicamente pelo Google.

94.3 GPQA-Diamond
Ficha de may 2026 1 benchmark
nvidia

Gemma-4-31B-IT-NVFP4

NVIDIA quantiza o Gemma 4 31B do Google em NVFP4 via ModelOpt, mantendo degradação abaixo de 0,5 pp em benchmarks críticos (GPQA Diamond: 85,35%; AIME 2025: 87,60%) e viabilizando inferência multimodal de 256K tokens em hardware Blackwell com vLLM.

Lanzado may 2026 · other Sin benchmark declarado
google

gemma-4-E2B-it

Gemma 4 E2B é um modelo denso multimodal de 2,3B parâmetros efetivos (5,1B com embeddings) da Google DeepMind, licenciado em Apache 2.0, com suporte a texto, imagem e áudio em janela de contexto de 128K tokens — posicionado para inferência local em dispositivos móveis e laptops.

Lanzado may 2026 · apache-2.0 Sin benchmark declarado
google

gemma-4-E4B-it

Gemma 4 E4B é um modelo denso multimodal de 4,5B parâmetros efetivos (8B com embeddings) da Google DeepMind, licenciado em Apache 2.0, com janela de contexto de 128K tokens e suporte nativo a texto, imagem e áudio — projetado para execução local em laptops e dispositivos móveis.

Lanzado may 2026 · apache-2.0 Sin benchmark declarado
google

gemma-4-26B-A4B-it

Gemma 4 26B A4B é um modelo MoE multimodal do Google DeepMind com 25,2B parâmetros totais e apenas 3,8B ativos por inferência, janela de 256K tokens e licença Apache 2.0 — entregando desempenho próximo ao 31B denso com custo computacional de um modelo 4B.

Lanzado may 2026 · apache-2.0 Sin benchmark declarado
google

gemma-4-31B-it

Gemma 4 31B é um modelo denso multimodal de 30,7B parâmetros, Apache 2.0, com janela de 256K tokens e 89,2% no AIME 2026 sem ferramentas — desempenho de raciocínio que rivaliza com modelos proprietários de maior escala.

Lanzado may 2026 · apache-2.0 Sin benchmark declarado
deepseek-ai

DeepSeek-V4-Pro

DeepSeek-V4-Pro é um MoE de 1,6T parâmetros (49B ativados) com janela de 1M tokens e licença MIT que reduz FLOPs de inferência em 73% frente ao V3.2, posicionando-se como o modelo open-source de maior contexto e eficiência computacional disponível hoje.

Lanzado may 2026 · mit Sin benchmark declarado
deepseek-ai

DeepSeek-V4-Flash

DeepSeek-V4-Flash é um MoE de 284B parâmetros (13B ativados) com janela de 1 milhão de tokens e licença MIT, posicionado como alternativa de baixo custo computacional ao V4-Pro para implantações auto-hospedadas de longo contexto.

Lanzado may 2026 · mit Sin benchmark declarado
ibm-granite

granite-4.1-8b

IBM lança Granite-4.1-8B, modelo instruct de 8B parâmetros com contexto longo, licença Apache 2.0 e capacidades aprimoradas de tool calling e RAG — posicionado como base para agentes empresariais em 12 idiomas.

Lanzado may 2026 · apache-2.0 Sin benchmark declarado
mistralai

Mistral-Medium-3.5-128B

Mistral Medium 3.5 é um modelo denso de 128B parâmetros com janela de 256k tokens, visão nativa e raciocínio configurável por requisição — unificando em um único conjunto de pesos o que antes exigia modelos separados (Medium 3.1, Magistral, Devstral 2).

Lanzado may 2026 · other Sin benchmark declarado

Gemini 3 Pro

Gemini 3 Pro registra 91,9% no GPQA-Diamond, posicionando-se entre os modelos de fronteira em raciocínio científico, mas detalhes arquiteturais oficiais ainda não foram divulgados pelo Google.

91.9 GPQA-Diamond
Ficha de may 2026 1 benchmark

GPT-5.2

GPT-5.2 é um modelo intermediário da OpenAI com 92,4% no GPQA-Diamond, posicionado entre gerações da família GPT-5 em um momento em que a empresa pressiona por migração de prompts legados.

92.4 GPQA-Diamond
Ficha de may 2026 1 benchmark

Gemini 3.1 Pro

Gemini 3.1 Pro registra 94,1% no GPQA-Diamond, mas ausência de ficha técnica pública impede avaliação arquitetural independente — posicionamento no mercado depende inteiramente de divulgação do Google.

94.1 GPQA-Diamond
Ficha de may 2026 1 benchmark
ibm-granite

granitelib-guardian-r1.0

IBM lança quatro adaptadores LoRA sobre o Granite 4.0 Micro para guardrails de segurança, detecção e correção de alucinações e verificação de conformidade com políticas — sob licença Apache-2.0.

Lanzado may 2026 · apache-2.0 Sin benchmark declarado
ibm-granite

granitelib-core-r1.0

IBM lança três adaptadores LoRA sobre o Granite 4.0 Micro que adicionam atribuição de contexto, verificação de requisitos e pontuação de incerteza calibrada — funcionalidades de explicabilidade e auditoria sem custo de fine-tuning completo.

Lanzado may 2026 · apache-2.0 Sin benchmark declarado
CohereLabs

tiny-aya-base

tiny-aya-base é um modelo de linguagem multilíngue compacto da Cohere Labs, lançado sob licença não-comercial CC-BY-NC-4.0, posicionado para pesquisa em idiomas de baixos recursos com footprint computacional reduzido.

Lanzado may 2026 · cc-by-nc-4.0 Sin benchmark declarado
CohereLabs

tiny-aya-fire

tiny-aya-fire é um modelo compacto multilíngue da Cohere Labs, lançado em maio de 2026 sob licença CC-BY-NC-4.0, com detalhes técnicos ainda não divulgados publicamente.

Lanzado may 2026 · cc-by-nc-4.0 Sin benchmark declarado
CohereLabs

tiny-aya-global

Tiny-aya-global é um modelo multilíngue compacto da CohereLabs lançado em maio de 2026 sob licença CC-BY-NC-4.0, posicionado para inferência de baixo custo em cenários globais — mas detalhes técnicos públicos ainda são escassos.

Lanzado may 2026 · cc-by-nc-4.0 Sin benchmark declarado
NVIDIA

NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4

NVIDIA's 120B sparse MoE with 12B active parameters, shipped at NVFP4 4-bit precision so it inferences on a single H200 — the most aggressive cost-per-token cut from a frontier-tier open weight model this quarter.

88.4 GPQA-Diamond 81.7 MMLU-Pro
Lanzado may 2026 · NVIDIA Open Model License 2 benchmarks
Qwen

Qwen3.5-122B-A10B-FP8

Qwen3.5-122B-A10B-FP8 é uma MoE multimodal de 122B parâmetros totais (10B ativos) com arquitetura híbrida Gated DeltaNet + atenção esparsa, contexto nativo de 262K tokens e quantização FP8, sob licença Apache-2.0.

Lanzado abr 2026 · apache-2.0 Sin benchmark declarado
OpenAI

GPT-5.5

OpenAI's flagship reasoning model — third on GPQA-Diamond at 93.5 — and the model behind the recent enterprise pricing reset (2× per-token vs GPT-5.4) plus the Codex CLI subscription bundle.

93.5 GPQA-Diamond
Lanzado abr 2026 · Proprietary (OpenAI API) 1 benchmark
google

gemma-4-E2B

Gemma 4 E2B é um modelo denso multimodal de 2,3B parâmetros efetivos (5,1B com embeddings) da Google DeepMind, licenciado sob Apache 2.0, otimizado para execução local em dispositivos móveis e laptops com suporte a texto, imagem e áudio em janela de contexto de 128K tokens.

Lanzado abr 2026 · apache-2.0 Sin benchmark declarado
Anthropic

Claude Opus 4.7

Anthropic's flagship reasoning model — currently #1 on GPQA-Diamond at 94.2 — and the model that anchors the Managed Agents API + Claude Code routines that operator-grade workflows depend on.

94.2 GPQA-Diamond
Lanzado mar 2026 · Proprietary (Anthropic API) 1 benchmark
mistralai

Voxtral-Mini-4B-Realtime-2602

Voxtral Mini 4B Realtime é o primeiro modelo open-source de transcrição de voz em streaming a atingir WER médio de 8,72% a 480ms de latência — paridade prática com sistemas offline — sob licença Apache-2.0.

Lanzado mar 2026 · apache-2.0 Sin benchmark declarado

De dónde vienen los números

Cada ficha guarda la lista de fuentes de donde salieron los números. Ningún índice de esta página lo producimos nosotros — cuando el laboratorio no divulga, la ficha lo dice.

Leer la metodología