Databricks ha añadido Precision Mode a su API `ai_extract`, abordando tres modos de fallo en extracción basada en LLM: resolución de referencias entre páginas en documentos largos, salidas anidadas que exceden límites de contexto y esquemas que requieren razonamiento entre múltiples secciones. El lanzamiento incluye disponibilidad general para `ai_parse_document` y una tubería nativa SQL componible — `ai_parse_document` → `ai_extract` → `ai_classify` — que procesa documentos dentro de Unity Catalog sin servicios externos de OCR o extracción. Intercontinental Exchange, Panasonic y EY-Parthenon ya procesan millones de documentos semanalmente a través del sistema.

En aproximadamente 9.000 documentos abarcando 10 conjuntos de datos internos y 5 benchmarks públicos (VAREX, RealDocBench, LongExtractBench, LEDGER, Caselaw Access Project), Precision Mode supera al siguiente mejor modelo de frontera en 7 puntos. La línea de base es chunk-and-merge con GPT, Claude y Gemini—no procesamiento de llamada única, que falla en documentos que exceden ventanas de contexto. Los documentos de prueba llegaban hasta 2.000 páginas con esquemas incluyendo 300+ campos anidados.

La arquitectura acopla modelos de extracción personalizados y específicos de tarea con un arnés agéntico inspirado en MemEx. El arnés descompone semánticamente grandes trabajos de extracción, genera subagentes paralelos para cada fragmento, preserva resultados intermedios y los reconcilia en salida estructurada. Este patrón descomponer-ejecutar-fusionar maneja reconciliación entre páginas: un arrendamiento con términos de renovación en página 1 referenciando una cláusula en página 80 es procesado por un agente rastreando esa dependencia en lugar de página por página.

Databricks se diferencia de competidores como Azure Document Intelligence al eliminar reprocesamiento redundante. La extracción basada en VLM reprocesa el documento completo en cada llamada. La arquitectura parse-once de Databricks produce una capa silver reutilizable en Delta; las llamadas posteriores de `ai_extract` e `ai_classify` leen desde esa capa. Databricks informa costos 5–7x menores que tuberías comparables y costos 3–5x menores frente a VLMs líderes en benchmarks OmniOCR. Loopback Analytics, procesando notas clínicas, logró costo 90% menor que su enfoque anterior.

La ganancia de calidad se extiende a RAG. Preprocesamiento de documentos a través de `ai_parse_document` antes de la ingestión en frameworks de agentes produjo una ganancia de rendimiento promedio del 16% en documentos de bonos del tesoro vía OfficeQA. Agentes fronterizos sin mejor análisis puntuaron por debajo del 50% en tareas de razonamiento de documentos—no por modelos de razonamiento débiles, sino por texto de entrada malformado. Tablas renderizadas como texto plano, referencias entre columnas rotas, datos de figuras perdidos. Arreglar la capa de extracción, no la capa de razonamiento, movió el número.

Para equipos de RAG: la tubería es nativa SQL. `ai_parse_document` ingiere PDFs, imágenes, documentos Word y diapositivas vía Lakeflow Spark Declarative Pipelines, escribiendo JSON estructurado a Unity Catalog. Las llamadas de `ai_extract` posteriores hacen referencia a esa salida. La misma llamada SQL maneja 100 facturas o 100.000 en infraestructura de lote sin servidor sin rearquitecturizar. Unity Catalog proporciona linaje, control de acceso granular y auditoría.

Una limitación: `ai_parse_document` es generativo, no determinístico. Las pruebas de la comunidad muestran imprecisiones ocasionales de transcripción en identificadores precisos—nombres, IDs, códigos—donde analizadores determinísticos serían exactos. Para flujos de trabajo priorizando precisión de identificador sobre fidelidad de diseño, evalúe un enfoque híbrido (análisis determinístico para PDFs legibles por máquina, `ai_parse_document` para documentos escaneados o con diseño pesado) antes de comprometerse.

Si su tubería RAG tiene un paso de extracción mediocre, arreglarlo aguas arriba con `ai_parse_document` y Precision Mode es ahora la mejora de precisión con mayor apalancamiento disponible en el stack Databricks a escala de producción.