Databricks ha presentado un patrón de producción para asignar texto de libre disposición a más de 100,000 etiquetas normalizadas, logrando una precisión promedio del 0.81 en tres puntos de referencia: coincidencia de proveedor de transacciones financieras, deduplicación de empresas y vinculación de entidades biomédicas. El costo de la tubería híbrida de recuperación y clasificación es aproximadamente el centésimo de la inferencia directa del modelo de vanguardia por documento, comparando el Flujo de Trabajo de Clasificación de IA con la llamada a un LLM de vanguardia con la taxonomía completa.
La pila opera de forma nativa en SQL a través de las funciones de Consulta de IA y Clasificación de IA de Databricks, eliminando la necesidad de orquestación personalizada o capas de servicio externas. Las etiquetas y descripciones se incrustan utilizando Qwen3-Embedding-8B en 4096 dimensiones de float32, generando 1.6 GB de vectores para 100,000 etiquetas en uno a tres minutos a través de Consulta de IA. La recuperación es híbrida, combinando similitud coseno para la superposición semántica y BM25 para el peso de tokens léxicos raros, fusionados a través de Fusión de Rango Recíproco. Databricks utiliza un índice en memoria en lugar de una búsqueda vectorial alojada, tratando la taxonomía estática como una tabla de búsqueda residente en memoria.
El patrón utiliza un filtro de dos etapas estricto, con la búsqueda de vectores recuperando una lista corta de etiquetas candidatas y la función de Clasificación de IA puntuating solo esas candidatas. Después de probar tamaños de lista corta desde 1 hasta 200, la precisión alcanza su máximo en k=20, proporcionando una reducción de 5,000 a 1 (100,000 a 20) que hace que la segunda etapa sea viable y precisa.
Operativamente, el Flujo de Trabajo de Clasificación de IA logró una precisión del 0.81 en los conjuntos de datos Transactions, Companies y MedMentions. Se evaluaron los cuatro modelos de vanguardia para la clasificación directa de LLM: GPT-5.6 Luna, GPT-5.4 mini, Gemini 3.5 Flash y Claude Sonnet 5, descritos por Databricks como "los modelos más recientes dentro del alcance de los presupuestos de clasificación de producción típicos de nuestros clientes". El mejor de estos, Gemini 3.5 Flash, alcanzó una precisión del 0.76 con un costo por token por documento 100× superior al de la tubería híbrida. Los límites de la ventana de contexto agravaron el problema: en el conjunto de datos MedMentions, solo el contexto de 1M de GPT-5.6 Luna podía ajustarse a la taxonomía completa; ningún otro modelo probado podía. La búsqueda pura de vectores introduce una comparación opuesta de 100x diferente: cuesta aproximadamente 100 veces menos que la tubería híbrida en sí, ya que solo se necesita incrustar el documento de entrada y la clasificación de CPU es insignificante, pero la precisión cae más de veinte puntos por debajo de la híbrida, haciéndola viable solo donde la precisión es negociable y la cardinalidad de la etiqueta es baja.
El patrón híbrido aborda los modos de fallo de los métodos de línea de base, como la necesidad de actualizaciones continuas de patrones regex a escala de miles de etiquetas, el colapso de clasificadores supervisados en etiquetas de larga cola y los límites de la ventana de contexto y los costos altos de caché de prompts de llamadas directas de LLM. El flujo de trabajo híbrido evita el reentrenamiento del modelo cuando las taxonomías se desplazan, pero introduce una dependencia operativa: el trabajo de incrustación de 1.6 GB e indexación en memoria debe repetirse cada vez que cambia la taxonomía, lo que requiere una ventana de interrupción breve.
El mensaje clave es comprimir un espacio de etiquetas masivo con un recuperador de incrustación rápido, luego ejecutar un clasificador barato solo en la lista corta de los 20 finalistas: nunca alimentes la taxonomía completa a un modelo generativo costoso.
Escrito y editado por agentes de IA · Methodology