Una ficha por modelo: lo que el laboratorio declaró, los benchmarks que publicó y la cobertura en que apareció. Los números son de la fuente — no hacemos evaluación propia.
Parakeet-CTC-1.1B é um modelo FastConformer CTC de 1,1B parâmetros desenvolvido pela NVIDIA e Suno.ai para ASR em inglês, atingindo WER de 1,83% no LibriSpeech clean — referência competitiva para implantação em produção sob licença CC-BY-4.0.
nvidiaNVIDIA lança modelo ASR de 600M parâmetros com arquitetura cache-aware FastConformer-RNNT para transcrição em streaming de baixa latência em 40 localidades de idiomas, com WER de 5,48% no português brasileiro no FLEURS.
nvidiaNemotron-3-Nano-30B-A3B-BF16 é um MoE híbrido com apenas 3,5B parâmetros ativos em 30B totais, projetado pela NVIDIA para raciocínio configurável com desempenho superior ao Qwen3-30B-A3B em codificação e provas matemáticas formais.
microsoftPhi-4 é um modelo denso de 14B parâmetros da Microsoft, treinado com 9,8T tokens de dados sintéticos e curados de alta qualidade, projetado para raciocínio avançado em ambientes com restrições de memória e latência — licença MIT.
googleGoogle lança variante QAT w4a16 do Gemma 4 E2B em formato Compressed Tensors, preservando qualidade bfloat16 com footprint de memória drasticamente reduzido para inferência nativa no vLLM — aposta direta em edge e GPU de consumidor.
deepseek-aiDeepSeek-V4-Flash-DSpark é o checkpoint DeepSeek-V4-Flash (284B parâmetros, 13B ativados, contexto de 1M tokens) com um módulo de decodificação especulativa acoplado, licença MIT, sem alterações nos pesos do modelo base.
mistralaiMinistral 3 3B Instruct 2512 é um modelo multimodal de 3,4B parâmetros (+ encoder de visão de 0,4B) da Mistral, com janela de contexto de 256k tokens, licença Apache 2.0 e footprint de 8GB VRAM em FP8 — posicionado para inferência de borda com visão nativa e function calling.
mistralaiDevstral Small 2 é um LLM de engenharia de software de 24B parâmetros com janela de 256k tokens, licença Apache 2.0 e score de 68% no SWE-bench Verified — equiparando modelos proprietários muito maiores a uma fração do custo computacional.
nvidiaNVIDIA quantiza o Qwen3.5-397B-A17B da Alibaba para NVFP4, reduzindo footprint de memória com paridade ou ganho mensurável frente à versão FP8 em benchmarks como GPQA Diamond (0.871) e LiveCodeBench V6 (0.843 vs 0.837).
nvidiaNemotron-3-Ultra-550B-A55B é um MoE híbrido de 550B parâmetros totais e 55B ativos, com contexto de 1M tokens e quantização NVFP4 nativa, posicionando a NVIDIA como fornecedora de modelo frontier próprio para workloads agentic de alto custo computacional.
—Claude Opus 4.8 reposiciona a Anthropic no segmento de agentes autônomos com redução de preço de dois terços e GPQA-Diamond de 93,6%, tornando raciocínio de nível especialista economicamente viável em pipelines de produção.
Claude Fable 5 é o modelo mais capaz da Anthropic em benchmarks científicos (GPQA-Diamond 94,1%), mas seu acesso foi suspenso por intervenção governamental dos EUA, tornando-o um ativo estratégico sob controle regulatório direto.
NVIDIA quantizou o Qwen3-35B-A3B da Alibaba para FP4, reduzindo custo de inferência com apenas 3B parâmetros ativados por token em arquitetura MoE, mantendo janela de contexto de 262K e suporte a texto, imagem e vídeo.
nvidiaDiffusionGemma 26B A4B IT quantizado em NVFP4 pela NVIDIA entrega geração de texto via difusão discreta a mais de 1.100 tokens/s em H100, com 3,8B parâmetros ativos em arquitetura MoE e janela de contexto de 256K tokens — combinando custo de inferência de modelo small com capacidade multimodal de modelo large.
googleDiffusionGemma 26B A4B é um modelo multimodal MoE da Google DeepMind que substitui autogressão token-a-token por difusão discreta em blocos, atingindo mais de 1.100 tokens/s em H100 FP8 — com tradeoff mensurável de qualidade frente ao Gemma 4 base.
googleGoogle lança Gemma 4 12B em formato QAT w4a16 via compressed-tensors, viabilizando inferência otimizada no vLLM com qualidade próxima ao bfloat16 e janela de contexto de 256K tokens sob licença Apache 2.0.
googleGoogle DeepMind lança versão quantizada com QAT do Gemma 4 31B denso em formato compressed-tensors w4a16, permitindo inferência nativa no vLLM com qualidade próxima ao bfloat16 e footprint de memória drasticamente reduzido — relevante para equipes que precisam rodar 31B parâmetros em hardware de workstation.
nvidiaNVIDIA lança Nemotron-Labs-Diffusion-8B-Base, modelo denso tri-modo que combina decodificação autorregressiva, difusão paralela e auto-especulação no mesmo conjunto de pesos, atingindo 850 tok/seg em GB200 — 3,3x acima do AR padrão.
CohereLabsCohere lança modelo de transcrição sob licença Apache 2.0 em maio de 2026, mas a ausência de documentação pública impede avaliação técnica independente no momento.
ibm-graniteIBM lança Granite Speech 4.1 2B, modelo compacto de fala com 2B parâmetros, suporte a ASR e tradução bidirecional em 6 idiomas, treinado com 174 mil horas de áudio, sob licença Apache 2.0.
ibm-graniteIBM lança modelo de embeddings multilíngue de 311M parâmetros com arquitetura ModernBERT, janela de 32k tokens e ganho de +14,5 pontos em benchmarks MTEB frente à geração anterior — licença Apache 2.0 viabiliza adoção corporativa irrestrita.
nvidiaNVIDIA quantiza o Kimi-K2.5 da Moonshot AI em NVFP4, mantendo benchmarks praticamente intactos (AIME 2025: 96,3 vs. 96,1 de base) e viabilizando inferência do modelo de 1T parâmetros em hardware Blackwell via vLLM.
microsoftRAD-DINO é um Vision Transformer ViT-B/14 da Microsoft treinado com autossupervisão (DINOv2) em 882 mil radiografias de tórax, entregando embeddings de imagem médica sem necessidade de supervisão textual.
—Claude Opus 4.7 com janela de 1M tokens entrega 94,2% no GPQA-Diamond e arquitetura subquadrática SubQ, posicionando-se como opção viável para raciocínio científico em escala documental sem custo quadrático de atenção.
Gemini 3.5 Pro registra 94,3% no GPQA-Diamond, benchmark de raciocínio científico de nível especialista, mas detalhes de arquitetura e disponibilidade ainda não foram divulgados publicamente pelo Google.
NVIDIA quantiza o Gemma 4 31B do Google em NVFP4 via ModelOpt, mantendo degradação abaixo de 0,5 pp em benchmarks críticos (GPQA Diamond: 85,35%; AIME 2025: 87,60%) e viabilizando inferência multimodal de 256K tokens em hardware Blackwell com vLLM.
googleGemma 4 E2B é um modelo denso multimodal de 2,3B parâmetros efetivos (5,1B com embeddings) da Google DeepMind, licenciado em Apache 2.0, com suporte a texto, imagem e áudio em janela de contexto de 128K tokens — posicionado para inferência local em dispositivos móveis e laptops.
googleGemma 4 E4B é um modelo denso multimodal de 4,5B parâmetros efetivos (8B com embeddings) da Google DeepMind, licenciado em Apache 2.0, com janela de contexto de 128K tokens e suporte nativo a texto, imagem e áudio — projetado para execução local em laptops e dispositivos móveis.
googleGemma 4 26B A4B é um modelo MoE multimodal do Google DeepMind com 25,2B parâmetros totais e apenas 3,8B ativos por inferência, janela de 256K tokens e licença Apache 2.0 — entregando desempenho próximo ao 31B denso com custo computacional de um modelo 4B.
googleGemma 4 31B é um modelo denso multimodal de 30,7B parâmetros, Apache 2.0, com janela de 256K tokens e 89,2% no AIME 2026 sem ferramentas — desempenho de raciocínio que rivaliza com modelos proprietários de maior escala.
deepseek-aiDeepSeek-V4-Pro é um MoE de 1,6T parâmetros (49B ativados) com janela de 1M tokens e licença MIT que reduz FLOPs de inferência em 73% frente ao V3.2, posicionando-se como o modelo open-source de maior contexto e eficiência computacional disponível hoje.
deepseek-aiDeepSeek-V4-Flash é um MoE de 284B parâmetros (13B ativados) com janela de 1 milhão de tokens e licença MIT, posicionado como alternativa de baixo custo computacional ao V4-Pro para implantações auto-hospedadas de longo contexto.
ibm-graniteIBM lança Granite-4.1-8B, modelo instruct de 8B parâmetros com contexto longo, licença Apache 2.0 e capacidades aprimoradas de tool calling e RAG — posicionado como base para agentes empresariais em 12 idiomas.
mistralaiMistral Medium 3.5 é um modelo denso de 128B parâmetros com janela de 256k tokens, visão nativa e raciocínio configurável por requisição — unificando em um único conjunto de pesos o que antes exigia modelos separados (Medium 3.1, Magistral, Devstral 2).
—Gemini 3 Pro registra 91,9% no GPQA-Diamond, posicionando-se entre os modelos de fronteira em raciocínio científico, mas detalhes arquiteturais oficiais ainda não foram divulgados pelo Google.
GPT-5.2 é um modelo intermediário da OpenAI com 92,4% no GPQA-Diamond, posicionado entre gerações da família GPT-5 em um momento em que a empresa pressiona por migração de prompts legados.
Gemini 3.1 Pro registra 94,1% no GPQA-Diamond, mas ausência de ficha técnica pública impede avaliação arquitetural independente — posicionamento no mercado depende inteiramente de divulgação do Google.
IBM lança quatro adaptadores LoRA sobre o Granite 4.0 Micro para guardrails de segurança, detecção e correção de alucinações e verificação de conformidade com políticas — sob licença Apache-2.0.
ibm-graniteIBM lança três adaptadores LoRA sobre o Granite 4.0 Micro que adicionam atribuição de contexto, verificação de requisitos e pontuação de incerteza calibrada — funcionalidades de explicabilidade e auditoria sem custo de fine-tuning completo.
CohereLabstiny-aya-base é um modelo de linguagem multilíngue compacto da Cohere Labs, lançado sob licença não-comercial CC-BY-NC-4.0, posicionado para pesquisa em idiomas de baixos recursos com footprint computacional reduzido.
CohereLabstiny-aya-fire é um modelo compacto multilíngue da Cohere Labs, lançado em maio de 2026 sob licença CC-BY-NC-4.0, com detalhes técnicos ainda não divulgados publicamente.
CohereLabsTiny-aya-global é um modelo multilíngue compacto da CohereLabs lançado em maio de 2026 sob licença CC-BY-NC-4.0, posicionado para inferência de baixo custo em cenários globais — mas detalhes técnicos públicos ainda são escassos.
NVIDIANVIDIA's 120B sparse MoE with 12B active parameters, shipped at NVFP4 4-bit precision so it inferences on a single H200 — the most aggressive cost-per-token cut from a frontier-tier open weight model this quarter.
Qwen3.5-122B-A10B-FP8 é uma MoE multimodal de 122B parâmetros totais (10B ativos) com arquitetura híbrida Gated DeltaNet + atenção esparsa, contexto nativo de 262K tokens e quantização FP8, sob licença Apache-2.0.
OpenAIOpenAI's flagship reasoning model — third on GPQA-Diamond at 93.5 — and the model behind the recent enterprise pricing reset (2× per-token vs GPT-5.4) plus the Codex CLI subscription bundle.
Gemma 4 E2B é um modelo denso multimodal de 2,3B parâmetros efetivos (5,1B com embeddings) da Google DeepMind, licenciado sob Apache 2.0, otimizado para execução local em dispositivos móveis e laptops com suporte a texto, imagem e áudio em janela de contexto de 128K tokens.
AnthropicAnthropic's flagship reasoning model — currently #1 on GPQA-Diamond at 94.2 — and the model that anchors the Managed Agents API + Claude Code routines that operator-grade workflows depend on.
Voxtral Mini 4B Realtime é o primeiro modelo open-source de transcrição de voz em streaming a atingir WER médio de 8,72% a 480ms de latência — paridade prática com sistemas offline — sob licença Apache-2.0.