aiexpert
Início / Notícias / Nota
Research · 18 de ago. de 2026, 10:34 · 4 fontes

Grounded Reasoning Cup: Stanford vence com 63,3% em documentos de Tesouro não vistos; baselines de fronteira lag em <30% de precisão

Databricks realizou a Grounded Reasoning Cup inaugural, uma competição de agentes ao vivo testando 11 times académicos em sua habilidade de raciocínio sobre coleções de documentos empresariais. O time de Stanford venceu com 63,3% de precisão em um benchmark previamente não visto (120.000 páginas de documentos do Tesouro dos EUA), superando a linha de base média de agentes de fronteira (menos de 30%) por 35 pontos e outros times por 22 pontos. A competição executou seis rodadas de 15 minutos com perguntas progressivamente mais difíceis, com times tendo apenas 36 horas para indexar e se preparar no novo corpus.

A descoberta-chave: generalização de benchmark é frágil. Times desenvolveram e otimizaram em OfficeQA mas descobriram que melhorias não se transferiam confiavelmente para a nova tarefa. A lacuna média entre o melhor e pior time usando o mesmo modelo de fronteira era de 30,4 pontos—sublinhando que arquitetura de sistema (parsing, retrieval, verificação, composição de ferramentas, paralelismo) importa tanto quanto o LLM subjacente. Dezoito por cento de todas as perguntas não foram resolvidas por nenhum time, indicando espaço substancial para melhoria contínua em raciocínio de documento empresarial.

A abordagem vencedora de Stanford combinou uma biblioteca de habilidades reusáveis, estratégias de fallback direcionadas para diferentes representações de documento, decomposição de agente paralela, uso de ferramenta estruturada e loops de verificação end-to-end. Os resultados enfatizam que raciocínio grounded empresarial não é um problema puro de capacidade de modelo; requer orquestração cuidadosa de retrieval, parsing, padrões de uso de ferramentas e validação.

Este padrão se alinha com sinais mais amplos: agentes de fronteira exibem forte capacidade zero-shot mas requerem ajuste substancial para generalização de domínio. Para arquitetos construindo sistemas de raciocínio de documento de produção ou aplicações de busca empresarial, a lacuna de habilidade de 30 pontos e taxa de 18% não resolvida sugerem que avaliação em domínios retidos e orquestração multi-agente são essenciais antes do deployment.

Fontes

Tudo que sustenta esta nota
  1. 01 Primary source databricks.com
  2. 02 databricks.com databricks.com “Stanford won with 63.3% accuracy, beating average team by 22 points, average frontier baseline by 35 points. Average frontier agent offline baseline less than 30% accuracy.”
  3. 03 databricks.com databricks.com “Generalization cannot be assumed. Techniques on OfficeQA did not always transfer to new benchmark. 18.8% of questions went unsolved by all teams. Average gap between top and lowest scoring teams using same model was 30.4 points.”
  4. 04 databricks.com databricks.com “Competition used U.S. Treasury Accounts of Receipts and Expenditures (120,000 pages). Teams had 36 hours of prep. Six 15-minute rounds with 15 questions per round, progressively harder.”