§ BEAT
Pesquisa
LangChain lança Harbor para benchmarking de agentes do mundo real
SWE-Pruner Pro Reduz o Uso de Tokens de Agente de Codificação em 39%
Julgadores de LLM Invertem 85% das Sentenças com Respostas de Referência
Apple's MM-ToolSandBox Revela Por Que Metade dos Agentes IA na Fronteira Falha em Tarefas Visuais
ZoRRO Combina CTR de Aprendizado Profundo com Velocidade 600×
Claude Opus Não Consegue Metade das Tarefas do Mundo Real no UniClawBench
OpenAI Revela que 30% das Tarefas do SWE-Bench Pro Estão Quebradas
SearchGen-20K Ensina Geradores Visuais Quando Pesquisar
Novo Método de Verificação Atinge 86,5% em Terminal-Bench Sem Ajuste Fino
Monitor de Limite Simples Iguala Salvaguardas Complexas de LLMs em Artigo do ICML
Três grandes benchmarks inflacionam escores de agentes de código, auditoria descobre
Baselines de Prompting Simples Superam Métodos de Supervisão Complexa
Contexto da Língua Original Recupera Precisão Perdida em Cascatas Multilíngues
Probabilidade de Sequência Falha como Sinal de Inferência em Produção
RiVER Permite Aprendizado por Reforço Sem Rótulos de Verdade Absoluta
A Alucinação de Modelos Mundiais é um Problema de Dados, Não de Arquitetura
Benchmark FFASR Expõe Lacuna no Reconhecimento de Fala em Campo Distante
Correção de Regex Rigoroso Aumenta Recall de Avaliação de Agentes em 60 Pontos Percentuais
Aprendizado em Contexto Amortizado Reduz o Custo de Serviço Few-Shot
Apenas 10,5% do Código Gerado por IA Passa em Verificações de Segurança
A Decodificação Real da DiffusionGemma Contradiz as Afirmativas de Decodificação em Bloco da Google
Retreinamento de Máscara Esparsa Combina Desempenho de Distilação de Política Completa
EvoArena Benchmark Revela Colapso de Agentes em Ambientes em Evolução
Metade das Correções de Código Geradas por IA Não Passam na Revisão Humana
Recuperação de Token Fecha a Fossa de Precisão e Diminui a Computação de Inferência de VLM pela Metade
Quadros de Liderança de LLM Não Prevêem Confiabilidade em Produção
Grok 3 Supera Biologistas Credenciados em Tarefas de Laboratório Automático de DNA
FASE Reduz Custo de Detecção de Alucinações para 0,3% dos Concorrentes
Esquema EvalCards Expõe Falhas Sistematizadas em Metadados de Benchmarks de IA