Databricks publicó una guía de gestión de costos entre empresas para despliegues de codificación con IA en toda la organización, basándose en datos y aportes de Stripe, Coinbase, Uber y Ramp. El problema central es estructural: el precio basado en consumo se escala con la salida, no con el número de empleados, y la codificación agentic multiplica el volumen de tokens por ingeniero más rápido de lo que los modelos tradicionales de costo por asiento pueden rastrear. En Databricks, la codificación agentic mejoró todas las métricas de velocidad y produjo ganancias de salida de orden de magnitud en algunos equipos. El gasto se escaló en consecuencia.

La guía organiza el control de costos alrededor de la "frontera de eficiencia" — el conjunto de modelos que ofrecen el mejor precio por unidad de inteligencia, distinto de la frontera de inteligencia bruta que los laboratorios persiguen. Esta frontera se mueve rápido: nuevos modelos lanzados semanalmente ofrecen mejor relación precio/rendimiento que los titulares. Los benchmarks públicos son proxies pobres para tareas de codificación del mundo real. Databricks construyó evaluaciones internas, encontró modelos GLM competitivos y los implementó. Stripe probó Opus 4.7, encontró que no mejoró significativamente sobre Opus 4.6 a mayor costo y bloqueó el lanzamiento. Databricks observó regresiones de costos comparando Opus 5.0 con 4.8.

La flexibilidad del modelo enfrenta el bloqueo de arnés. Los modelos propietarios de frontera están co-diseñados para funcionar con arneses específicos, por lo que cambiar modelos a menudo significa cambiar toda la cadena de herramientas del desarrollador. La guía recomienda meta-arneses: una capa que proporciona UX consistente para desarrolladores mientras envía solicitudes a arneses subyacentes — propietarios o de código abierto — basado en el tipo de tarea y costo. Databricks abrió el código de su meta-arnés, Omnigent, y está lanzando una versión administrada en Databricks bajo gobernanza de Unity AI Gateway.

El enrutamiento añade una segunda palanca. A nivel de solicitud, un proxy con estado dirige cada inferencia al modelo más capaz de menor costo, teniendo en cuenta el estado del caché del lado del servidor. A nivel de tarea, el meta-arnés clasifica la complejidad — una operación de cambio de nombre versus una pregunta de arquitectura abierta — y envía la tarea al nivel apropiado antes de que se intercambien tokens. Smart Router de Unity AI Gateway opera a nivel de solicitud y reduce el costo promedio de tarea en más del 30%.

El caching de solicitud proporciona ganancias de mayor retorno con baja infraestructura. Las escrituras en caché cuestan dinero, pero las lecturas en caché reducen sustancialmente el gasto por inferencia en cargas de trabajo de contexto repetido. Ajustar la configuración de arnés y caching internamente le dio a Databricks una reducción del 50% en tokens generados sin pérdida de calidad observada. El control operacional principal es el ajuste de TTL de caché y la tasa de impacto por tipo de carga de trabajo.

La arquitectura de presupuesto es donde la mayoría de las organizaciones fallan. Los límites de gasto rígidos por usuario bloquean a los ingenieros equivocados — aquellos productivos ejecutando bucles agentic largos — mientras ignoran el desperdicio real: desove accidental de múltiples agentes en viernes por la noche o bucles de reintento que multiplican el costo 10× de la noche a la mañana. A la escala de Databricks, 500 a 1.000 ingenieros alcanzan límites rígidos mensualmente, inundando el canal interno #ai-devtools Slack con solicitudes de desbloqueo. El diseño de reemplazo empareja presupuestos diarios y mensuales en una proporción fija, para que los gastadores constantes nunca superen el límite diario, y utiliza reconocimientos de autoservicio para excedentes diarios en lugar de colas de aprobación. Los controles de gastos de Unity AI Gateway capa esto en usuario, caso de uso, espacio de trabajo y cuenta. La guía pública de Databricks ofrece ejemplos: presupuestos de $2.000/usuario/mes por ingeniero, alertas de $1.000/usuario/mes para cargas de trabajo de agente de codificación, $50.000/mes para espacios de trabajo de producción y límites de $200.000/mes a nivel organizacional — aunque la empresa señala que estos no son sus números internos reales.

La secuencia práctica: bloquear la flexibilidad del modelo primero a través de meta-arnés o enrutamiento de puerta de entrada, ajustar cachés, luego agregar lógica de enrutamiento, luego reemplazar límites rígidos con presupuestos progresivos en capas. Las organizaciones sin observabilidad centralizada entre herramientas de codificación no tienen datos para optimizar. Unity AI Gateway pasó un cuatrillón de tokens en su primer año, dando al equipo de plataforma de Databricks la señal para iterar.