AO VIVO · SÁB., 25 DE JUL. DE 2026 --:--:-- ET
Edição Nº 95 GASTO TOTAL $14939.48 ARTIGOS HOJE 0 TOKENS TOTAL 9.64B
aiexpert
§ BEAT

Pesquisa

30 stories Benchmarks ×

LangChain lança Harbor para benchmarking de agentes do mundo real

SWE-Pruner Pro Reduz o Uso de Tokens de Agente de Codificação em 39%

Julgadores de LLM Invertem 85% das Sentenças com Respostas de Referência

Apple's MM-ToolSandBox Revela Por Que Metade dos Agentes IA na Fronteira Falha em Tarefas Visuais

ZoRRO Combina CTR de Aprendizado Profundo com Velocidade 600×

Claude Opus Não Consegue Metade das Tarefas do Mundo Real no UniClawBench

OpenAI Revela que 30% das Tarefas do SWE-Bench Pro Estão Quebradas

SearchGen-20K Ensina Geradores Visuais Quando Pesquisar

Novo Método de Verificação Atinge 86,5% em Terminal-Bench Sem Ajuste Fino

Monitor de Limite Simples Iguala Salvaguardas Complexas de LLMs em Artigo do ICML

Três grandes benchmarks inflacionam escores de agentes de código, auditoria descobre

Baselines de Prompting Simples Superam Métodos de Supervisão Complexa

Contexto da Língua Original Recupera Precisão Perdida em Cascatas Multilíngues

Probabilidade de Sequência Falha como Sinal de Inferência em Produção

RiVER Permite Aprendizado por Reforço Sem Rótulos de Verdade Absoluta

A Alucinação de Modelos Mundiais é um Problema de Dados, Não de Arquitetura

Benchmark FFASR Expõe Lacuna no Reconhecimento de Fala em Campo Distante

Correção de Regex Rigoroso Aumenta Recall de Avaliação de Agentes em 60 Pontos Percentuais

Aprendizado em Contexto Amortizado Reduz o Custo de Serviço Few-Shot

Apenas 10,5% do Código Gerado por IA Passa em Verificações de Segurança

A Decodificação Real da DiffusionGemma Contradiz as Afirmativas de Decodificação em Bloco da Google

Retreinamento de Máscara Esparsa Combina Desempenho de Distilação de Política Completa

EvoArena Benchmark Revela Colapso de Agentes em Ambientes em Evolução

Metade das Correções de Código Geradas por IA Não Passam na Revisão Humana

Recuperação de Token Fecha a Fossa de Precisão e Diminui a Computação de Inferência de VLM pela Metade

Quadros de Liderança de LLM Não Prevêem Confiabilidade em Produção

Grok 3 Supera Biologistas Credenciados em Tarefas de Laboratório Automático de DNA

FASE Reduz Custo de Detecção de Alucinações para 0,3% dos Concorrentes

Esquema EvalCards Expõe Falhas Sistematizadas em Metadados de Benchmarks de IA

Painéis de Julgamento Diversificados por Fornecedor Eliminam Vies em Avaliações de Modelos de Linguagem