Databricks lanzó Smart Routing en Beta dentro de Unity AI Gateway, un enrutador de modelos consciente de tareas que igualó el rendimiento de Opus 5 en puntos de referencia públicos de codificación a un costo 56% menor y redujo el gasto por tarea al 65% de Opus 5 en la base de código interna de Databricks. La función enruta sesiones de agentes de codificación al modelo más económico capaz de completar el trabajo sin cambiar el flujo de trabajo del desarrollador, integrándose directamente en Claude Code y Codex.
La decisión de enrutamiento se bloquea al inicio de la tarea durante toda la sesión. El enrutamiento por solicitud reduce las tasas de acierto de caché porque los turnos consecutivos deben llegar al mismo modelo y nivel de esfuerzo para reutilizar el caché. El enrutamiento a nivel de sesión preserva la eficiencia del caché mientras captura la mayoría de los ahorros de costos de modelos más económicos en tareas más simples.
El clasificador que realiza la llamada de enrutamiento es intencionalmente económico: un modelo pequeño y de baja latencia que lee la descripción de la tarea y la anota con campos semánticos—qué parte del sistema está cambiando, qué evidencia de código lleva el mensaje (un fragmento, rastreo de pila o nada), qué tan localizada es la solución, qué modo de fallo aparece y qué tipo de proyecto. A partir de esas etiquetas, deriva una familia de tipo de tarea y una familia de lenguaje. Sin contenido del repositorio, sin pruebas, sin respuestas—solo la descripción y metadatos. El enrutador utiliza por defecto un modelo de tamaño medio y escala a modelos de frontera o más económicos según esas etiquetas.
Smart Routing entregó ahorros de costos del 35% comparado con el propio punto de referencia de ingeniería de Databricks frente a enrutar todo a Opus 5. En puntos de referencia públicos (estilo SWE-bench) los ahorros alcanzaron el 56% mientras se igualaba el desempeño de Opus 5 en calidad. La brecha refleja la diversidad del mundo real: las tareas internas tienden hacia trabajo complejo de múltiples archivos; los puntos de referencia públicos tienen más ediciones de un solo archivo que los modelos más económicos manejan limpiamente. 2026 trajo 33 nuevos modelos de codificación al mercado, ampliando la superficie de enrutamiento.
Los equipos que optimizan entre arneses pueden usar Omnigent, un meta-arnés que empareja Smart Routing con la selección de arnés. Omnigent se ejecuta sobre la decisión de enrutamiento y selecciona el arnés de agente más adecuado para el modelo y la tarea. Se encuentra en el mismo plano de control de Unity AI Gateway que maneja la gestión de gastos y la política de acceso.
Databricks reconoce que el enrutador actual deja espacio de maniobra significativo. Un enrutador con previsión perfecta superaría cada modelo a una fracción del costo; el sistema actual cierra solo parte de esa brecha. Las sesiones reales exponen complejidad a mitad de la tarea—una corrección de error delimitada convirtiéndose en una refactorización de múltiples archivos. El enrutador no tiene mecanismo de reevaluación una vez en marcha, aunque el equipo apunta a la reevaluación a mitad de la sesión cuando el caché se vuelve obsoleto como objetivo a corto plazo. Mejorar el modelo de dimensionamiento de complejidad requiere ciclos de retroalimentación de producción, razón por la cual Beta se está lanzando ahora.
Si su infraestructura de agente de codificación configura por defecto cada tarea para un modelo de frontera, está pagando de más entre 35–56%. La solución es un clasificador que nunca ve su base de código—solo la descripción de la tarea.