A Databricks adicionou Precision Mode à sua API `ai_extract`, abordando três modos de falha em extração baseada em LLM: resolução de referências entre páginas em documentos longos, saídas aninhadas que excedem limites de contexto e esquemas que exigem raciocínio entre múltiplas seções. O lançamento inclui disponibilidade geral para `ai_parse_document` e um pipeline nativo SQL composável — `ai_parse_document` → `ai_extract` → `ai_classify` — que processa documentos dentro do Unity Catalog sem serviços externos de OCR ou extração. Intercontinental Exchange, Panasonic e EY-Parthenon já processam milhões de documentos semanalmente através do sistema.

Considerando aproximadamente 9.000 documentos abrangendo 10 conjuntos de dados internos e 5 benchmarks públicos (VAREX, RealDocBench, LongExtractBench, LEDGER, Caselaw Access Project), Precision Mode supera o próximo melhor modelo de fronteira em 7 pontos. A baseline é chunk-and-merge com GPT, Claude e Gemini—não processamento de chamada única, que falha em documentos que excedem janelas de contexto. Os documentos de teste chegaram a 2.000 páginas com esquemas incluindo 300+ campos aninhados.

A arquitetura acopla modelos de extração customizados e específicos de tarefa com um harness agêntico inspirado em MemEx. O harness decompõe semanticamente grandes trabalhos de extração, gera subagentes paralelos para cada chunk, preserva resultados intermediários e os reconcilia em saída estruturada. Este padrão decompose-execute-merge lida com reconciliação entre páginas: um arrendamento com termos de renovação na página 1 referenciando uma cláusula na página 80 é processado por um agente rastreando essa dependência ao invés de página por página.

Databricks se diferencia de concorrentes como Azure Document Intelligence ao eliminar reprocessamento redundante. Extração baseada em VLM reprocessa o documento completo em cada chamada. A arquitetura parse-once da Databricks produz uma camada silver reutilizável em Delta; as chamadas subsequentes de `ai_extract` e `ai_classify` leem dessa camada. Databricks relata custos 5–7x menores do que pipelines comparáveis e custos 3–5x menores versus VLMs líderes em benchmarks OmniOCR. Loopback Analytics, processando notas clínicas, alcançou custo 90% menor do que sua abordagem anterior.

O ganho de qualidade se estende ao RAG. Pré-processamento de documentos através de `ai_parse_document` antes da ingestão em frameworks de agentes produziu um ganho médio de desempenho de 16% em documentos de títulos de tesouro via OfficeQA. Agentes de fronteira sem análise melhor pontuaram abaixo de 50% em tarefas de raciocínio de documentos—não de modelos de raciocínio fraco, mas de texto de entrada malformado. Tabelas renderizadas como texto plano, referências entre colunas quebradas, dados de figura perdidos. Corrigir a camada de extração, não a camada de raciocínio, alterou o número.

Para equipes de RAG: o pipeline é nativo SQL. `ai_parse_document` ingere PDFs, imagens, documentos Word e slides via Lakeflow Spark Declarative Pipelines, escrevendo JSON estruturado para Unity Catalog. As chamadas de `ai_extract` downstream referenciam essa saída. A mesma chamada SQL lida com 100 faturas ou 100.000 em infraestrutura batch serverless sem rearquitetar. Unity Catalog fornece linhagem, controle de acesso fino e auditabilidade.

Uma limitação: `ai_parse_document` é generativo, não determinístico. Testes da comunidade mostram ocasionais imprecisões de transcrição em identificadores precisos—nomes, IDs, códigos—onde analisadores determinísticos seriam exatos. Para fluxos de trabalho priorizando precisão de identificador sobre fidelidade de layout, avalie uma abordagem híbrida (análise determinística para PDFs legíveis por máquina, `ai_parse_document` para documentos digitalizados ou com layout pesado) antes de comprometer.

Se seu pipeline RAG tem uma etapa de extração medíocre, corrigi-la upstream com `ai_parse_document` e Precision Mode é agora a melhoria de precisão com maior alavancagem disponível no stack Databricks em escala de produção.