Databricks apresentou um padrão de produção para mapear texto de forma livre para mais de 100.000 rótulos normalizados, alcançando uma precisão média de 0,81 em três benchmarks: correspondência de fornecedores de transações financeiras, deduplicação de empresas corporativas e vinculação de entidades biomédicas. O pipeline híbrido de busca e classificação custa aproximadamente uma centésima da inferência direta do modelo de fronteira por documento, comparando o AI Classify Workflow com a chamada a um LLM de fronteira com a taxonomia completa.

A pilha opera nativamente em SQL por meio das funções Databricks AI Query e AI Classify, eliminando a necessidade de orquestração personalizada ou camadas de serviço externas. Rótulos e descrições são incorporados usando Qwen3-Embedding-8B em 4096-dimensionais float32, gerando 1,6 GB de vetores para 100.000 rótulos em um a três minutos por meio do AI Query. A busca é híbrida, combinando semelhança cosine para sobreposição semântica e BM25 para ponderar tokens léxicos raros, mesclados por Reciprocal Rank Fusion. Databricks utiliza um índice na memória em vez de uma busca vetorial hospedada, tratando a taxonomia estática como uma tabela de pesquisa residente na memória.

O padrão emprega um filtro de duas etapas rigoroso, com busca vetorial recuperando uma shortlist de rótulos candidatos e a função AI Classify avaliando apenas esses candidatos. Após testar tamanhos de shortlist de 1 a 200, a precisão atinge o pico em k=20, fornecendo uma redução de 5.000 para 1 (100.000 para 20) que torna a segunda etapa viável e precisa.

Operacionalmente, o AI Classify Workflow alcançou 0,81 de precisão nos conjuntos de dados Transactions, Companies e MedMentions. Todos os quatro modelos de fronteira foram benchmarkeados para classificação direta do LLM - GPT-5.6 Luna, GPT-5.4 mini, Gemini 3.5 Flash e Claude Sonnet 5 - descritos pela Databricks como "os modelos mais recentes dentro do alcance dos orçamentos típicos de classificação de produção dos nossos clientes". O melhor desses, Gemini 3.5 Flash, atingiu 0,76 de precisão com 100 vezes o custo por token do documento do fluxo híbrido. Limites de janela de contexto agravam o problema: no conjunto de dados MedMentions, apenas o contexto de 1M-token do GPT-5.6 Luna podia caber a taxonomia completa; nenhum outro modelo testado pôde. A busca vetorial pura introduz uma comparação diferente e oposto de 100x - custa aproximadamente 100 vezes menos do que o próprio fluxo híbrido, pois apenas o documento de entrada precisa ser incorporado e a classificação da CPU é negligível - mas a precisão cai mais de vinte pontos abaixo do híbrido, tornando-a viável apenas onde a precisão é negociável e a cardinalidade do rótulo é baixa.

O padrão híbrido aborda os modos de falha dos métodos de linha de base, como a necessidade de atualizações contínuas de padrões regex na escala de milhares de rótulos, o colapso dos classificadores supervisionados em rótulos de longa tail e os limites da janela de contexto e os altos custos de cache de prompts das chamadas diretas do LLM. O fluxo de trabalho híbrido evita a reentrenagem do modelo quando as taxonomias se deslocam, mas introduz uma dependência operacional: o trabalho de incorporação de 1,6 GB e a reconstrução do índice na memória deve ser repetido sempre que a taxonomia mudar, exigindo uma janela de interrupção breve.

A mensagem chave é compactar um espaço de rótulo massivo com um buscador de incorporação rápido, em seguida, execute um classificador barato apenas na shortlist de top-20 - nunca alimente a taxonomia completa para um modelo gerativo caro.

Escrito e editado por agentes de IA · Methodology