Databricks publicou um guia de gerenciamento de custos entre empresas para implantações de codificação com IA em toda a organização, com dados e contribuições de Stripe, Coinbase, Uber e Ramp. O problema central é estrutural: o preço baseado em consumo escala com a saída, não com o número de funcionários, e a codificação agentic multiplica o volume de tokens por engenheiro mais rápido do que os modelos tradicionais de custo por assento conseguem rastrear. Na Databricks, a codificação agentic melhorou todas as métricas de velocidade e produziu ganhos de saída de magnitude ordem em alguns times. Os gastos escalaram junto.

O guia organiza o controle de custos em torno da "fronteira de eficiência" — o conjunto de modelos que oferecem o melhor preço por unidade de inteligência, diferente da fronteira de inteligência bruta que os laboratórios perseguem. Essa fronteira se move rápido: novos modelos lançados semanalmente oferecem melhor preço/desempenho que os incumbentes. Os benchmarks públicos são péssimos proxies para tarefas de codificação do mundo real. Databricks construiu avaliações internas, encontrou modelos GLM competitivos e os lançou. Stripe testou Opus 4.7, descobriu que não melhorou significativamente em relação a Opus 4.6 com maior custo e bloqueou o lançamento. Databricks observou regressões de custo comparando Opus 5.0 com 4.8.

A flexibilidade de modelo enfrenta lock-in de harness. Modelos proprietários de fronteira são co-projetados para funcionar com harnesses específicas, então trocar modelos geralmente significa trocar toda a caixa de ferramentas do desenvolvedor. O guia recomenda meta-harnesses: uma camada que fornece UX consistente para desenvolvedor enquanto despacha solicitações para harnesses subjacentes — proprietárias ou de código aberto — baseado no tipo de tarefa e custo. Databricks abriu o código de sua meta-harness, Omnigent, e está lançando uma versão gerenciada no Databricks sob governança Unity AI Gateway.

Roteamento adiciona uma segunda alavanca. No nível de solicitação, um proxy com estado direciona cada inferência para o modelo mais capaz de menor custo, considerando o estado do cache do lado do servidor. No nível de tarefa, a meta-harness classifica a complexidade — uma operação de renomeação versus uma pergunta de arquitetura aberta — e despacha a tarefa para o nível apropriado antes dos tokens serem trocados. O Smart Router do Unity AI Gateway opera no nível de solicitação e reduz o custo médio de tarefa em mais de 30%.

O caching de prompt fornece ganhos de maior retorno com baixa infraestrutura. Escritas de cache custam dinheiro, mas leituras em cache reduzem significativamente o gasto por inferência em cargas de trabalho de contexto repetido. Ajustar as configurações de harness e caching internamente deu a Databricks uma redução de 50% em tokens gerados sem perda de qualidade observada. O botão operacional principal é ajuste de TTL de cache e taxa de acerto por tipo de carga de trabalho.

Arquitetura de orçamento é onde a maioria das organizações falha. Limites de gasto rígidos por usuário bloqueiam os engenheiros errados — aqueles produtivos executando loops agentic longos — enquanto ignoram desperdício real: spawns acidentais de multi-agente em noites de sexta-feira ou loops de retry que multiplicam o custo 10× da noite para o dia. Na escala de Databricks, 500 a 1.000 engenheiros atingem limites rígidos mensalmente, inundando o canal interno #ai-devtools Slack com solicitações de desbloqueio. O design de substituição emparelha orçamentos diários e mensais em uma proporção fixa, para que os gastadores constantes nunca atinjam o limite diário, e usa confirmações de auto-atendimento para overruns diários em vez de filas de aprovação. Os controles de gastos do Unity AI Gateway colocam isso em camadas entre usuário, caso de uso, espaço de trabalho e conta. A orientação pública de Databricks oferece exemplos: $2.000/usuário/mês de orçamentos por engenheiro, alertas de $1.000/usuário/mês para cargas de trabalho de agente de codificação, $50.000/mês para espaços de trabalho de produção e limites de $200.000/mês no nível da organização — embora a empresa observe que esses não são seus números internos reais.

A sequência prática: bloquear flexibilidade de modelo primeiro via meta-harness ou roteamento de gateway, ajustar caches, depois adicionar lógica de roteamento, depois substituir limites rígidos por orçamentos progressivos em camadas. Organizações sem observabilidade centralizada entre ferramentas de codificação não têm dados para otimizar. Unity AI Gateway passou por um quatrilhão de tokens em seu primeiro ano, dando ao time de plataforma Databricks o sinal para iterar.