Databricks realizó la Grounded Reasoning Cup inaugural, una competiçón de agentes en vivo evaluando 11 equipos académicos en su capacidad para razonar sobre colecciones de documentos empresariales. El equipo de Stanford ganó con 63,3% de precisión en un benchmark previamente no visto (120.000 páginas de documentos del Tesoro de EE.UU.), superando la línea de base promedio del agente fronterizo (menos del 30%) por 35 puntos y otros equipos por 22 puntos. La competencia ejecutó seis rondas de 15 minutos con preguntas progresivamente más difíciles, con equipos teniendo solo 36 horas para indexar y prepararse en el nuevo corpus.
El hallazgo clave: la generalización de benchmarks es frágil. Los equipos desarrollaron y optimizaron en OfficeQA pero descubrieron que las mejoras no se transferían de manera confiable a la nueva tarea. La brecha promedio entre el mejor y el peor equipo usando el mismo modelo fronterizo fue de 30,4 puntos—subrayando que la arquitectura del sistema (parsing, recuperación, verificación, composición de herramientas, paralelismo) importa tanto como el LLM subyacente. Dieciocho por ciento de todas las preguntas no fueron resueltas por ningún equipo, lo que indica un espacio sustancial para mejorar continuamente el razonamiento de documentos empresariales.
El enfoque ganador de Stanford combinó una biblioteca de habilidades reutilizables, estrategias de respaldo dirigidas para diferentes representaciones de documentos, descomposición de agentes paralelos, uso de herramientas estructurado y bucles de verificación de extremo a extremo. Los resultados enfatizan que el razonamiento grounded empresarial no es un problema puro de capacidad del modelo; requiere una orquestación cuidadosa de recuperación, parsing, patrones de uso de herramientas y validación.
Este patrón se alinea con señales más amplias: los agentes fronterizos muestran una fuerte capacidad de zero-shot pero requieren ajuste sustancial para la generalización del dominio. Para arquitectos que construyen sistemas de razonamiento de documentos de producción o aplicaciones de búsqueda empresarial, la brecha de habilidad de 30 puntos y la tasa del 18% sin resolver sugieren que la evaluación en dominios retenidos y la orquestación multiagente son esenciales antes del despliegue.