Databricks ha de código abierto OfficeQA Pro V2, un benchmark de razonamiento fundamentado construido a partir de 120.000 páginas de registros financieros del U.S. Treasury que abarcan 233 años. El benchmark contiene 90 preguntas extraídas de un corpus nunca visto por ningún sistema bajo prueba—forzando la generalización en lugar de recompensar la memorización.
La motivación es directa: los modelos frontier mejoraron sustancialmente en el OfficeQA Pro original durante siete meses. Eso planteó una pregunta difícil—¿eran las ganancias evidencia de mejor razonamiento, u overfitting a un único corpus? Databricks lo probó a través de Grounded Reasoning Cup, un evento en vivo donde 11 equipos académicos respaldados por OpenAI, Anthropic y Google DeepMind construyeron agentes especializados contra un corpus no divulgado. El benchmark ahora es público.
Los harnesses estándar de proveedores—Claude Code para Anthropic, Codex para OpenAI—promediaron 26.0% de precisión en cinco modelos. Sonnet 5 obtuvo 15.6% a $5.01 por rollout; GPT-5.6 Sol alcanzó 33.3% a $4.70. El mayor gasto no aseguró mayor precisión. Los agentes de competencia construidos con propósito promediaron 41.1%, con el equipo ganador alcanzando 63.3%.
El hallazgo más grande: el agent harness importa más que el modelo subyacente. Ejecutar modelos frontier a través de Databricks Genie—que pre-parsea el corpus con ai_parse antes de cualquier interacción de agente—mejoró la precisión en 24.0 puntos en promedio, una ganancia relativa del 92%. En cuatro comparaciones directas de modelo, la precisión media pasó de 37.5% a 52.8%; la configuración Genie más fuerte alcanzó 60%. Claude Fable 5 es ilustrativo: Claude Code estándar promedió $37.36 por rollout e hizo bucles a través de intentos repetidos de parse; cambiar a Genie redujo el costo en 9x mientras sumaba 14.4 puntos de precisión. En la frontera costo-calidad, las configuraciones Genie con GPT-5.6 Luna, GPT-5.6 Terra y Claude Fable 5 dominaron—mejor precisión y menor costo que los estándares de proveedores.
Los modos de falla persistentes reflejan el benchmark original: errores de fidelidad de parsing, reconciliación temporal incorrecta en años fiscales, y cadenas de razonamiento multi-hop rompiéndose cuando la evidencia abarca secciones no contiguas. Estos no son edge cases—coinciden con los patrones de falla en colecciones de documentos de época mixta, inconsistentemente formateadas comunes en entornos empresariales.
El benchmark utiliza puntuación de exact-match determinística con 0.0% de tolerancia, el mismo enfoque que OfficeQA Pro. Esa rigidez evita la inflación del crédito parcial y mantiene los resultados comparables en configuraciones. El corpus—U.S. Treasury Accounts of Receipts and Expenditures, lanzado para el aniversario 250—está públicamente disponible para reproducción sin una cuenta de Databricks.
Para arquitectos que evalúan RAG o stacks de documento-agent, el benchmark está disponible para auto-evaluación. Los resultados de Genie demuestran que la infraestructura de pre-parsing es de primer orden, no un detalle de optimización. Un techo del 60% en 90 preguntas construidas a partir de PDFs gubernamentales debe moderar la confianza en cualquier sistema promovido para QA de documentos de producción.