aiexpert
Início / Podcast / Ep. 26
26
Episódio 26 · 10 de ago. de 2026 · 15 min · Plantão

A semana em que a conta dos agentes começou a apertar

A semana em que a economia da IA agêntica virou a restrição dominante — quem não otimizar memória, CPU e inferência vai financiar o roadmap do concorrente.

Apresentam AlanApresentação AdaApresentação
00:00 -15:28
Baixar MP3 RSS

Transcrição do episódio

O roteiro que foi ao ar, na íntegra
Alan

Onze dólares e quarenta e um centavos por gigabyte de DDR5. Preços de 2008.

Ada

A IA queimou vinte anos de deflação de memória em alguns meses. E o orçamento de infra que o CTO aprovou em janeiro já está furado.

Alan

Esta é a ai|expert Wire. A semana em que a economia da IA agêntica virou a restrição dominante — e quem não otimizar memória, CPU e inferência vai financiar o roadmap do concorrente.

Alan

Três choques simultâneos de infra esta semana: memória, CPU e tokens. Nenhum deles é cíclico. Todos convergem no mesmo ponto.

Ada

E a conta não vai esperar o próximo trimestre para chegar.

Alan

Começa pela memória. O Stanford DAM Project publicou os números: DDR5 está entre $11,41 e $13,28 por gigabyte — preços que não eram vistos desde 2008. A Counterpoint Research coloca a alta de DRAM em 80 a 90 por cento só no primeiro trimestre de 2026. A Bloomberg fala em 700 por cento de alta no spot price no último ano. O cientista Daniel Lemire resumiu sem rodeios: "RAM em base unitária está tão cara quanto em 2007. Não me lembro de anomalia histórica similar." [ref: ram-pricing-crisis-ai-demand-r]

Ada

O mecanismo é direto. Cada chip HBM empilha até 12 dies de DRAM. A NVIDIA B300 usa oito desses chips — 96 dies por placa. E para cada bit de HBM produzido, a Micron abre mão de três bits de DRAM convencional. Samsung, SK Hynix e Micron controlam mais de 95% da produção global de DRAM, e todas realocaram capacidade para HBM de aceleradores de IA. O resultado: centros de dados consomem agora 70% de todos os chips de memória produzidos no mundo. [ref: ram-pricing-crisis-ai-demand-r]

Alan

A demanda cresce a 200 por cento ao ano. A produção de memória cresce a 20 por cento. Esse diferencial não fecha em 2026. A SK Hynix vendeu toda a capacidade de produção de 2026 em outubro passado. O CEO da empresa avisou em julho: a demanda vai superar a oferta bem além de 2030. Arquitetos dimensionando cluster de inferência agora: trate alocação de HBM e DDR5 como restrição primária de planejamento. Não FLOPS. Memória.

Alan

O segundo choque é CPU. A Amazon, em maio, ordenou internamente que engenheiros parassem de desperdiçar ciclos de CPU. Instâncias EC2 que antes chegavam em horas agora demoram dias. Um engenheiro de múltiplos anos na empresa declarou ao The Information que nunca tinha esperado tanto tempo por uma instância de computação. [ref: amazons-cpu-crackdown-agentic-]

Ada

O motivo é estrutural. Inferência tradicional usava uma CPU para cada oito GPUs — trabalho leve de tokenização e roteamento. Workloads agênticos quebram esse modelo completamente. Cada loop de agente — planejar, chamar ferramenta, parsear resposta, re-tokenizar, rotear para o próximo sub-agente — roda quase inteiramente em CPU. Um paper da Georgia Tech e Intel mediu: processamento de ferramentas em CPU responde por 50 a 90 por cento da latência total em workloads agênticos. [ref: amazons-cpu-crackdown-agentic-]

Alan

O CFO da Intel, David Zinsner, confirmou na call de resultados do Q1 2026: a proporção CPU para GPU nos data centers já foi de 1:8 para 1:4, e pode convergir para 1:1 em deployments agênticos. Analistas do JP Morgan modelaram o ideal em sete CPUs por GPU. A Amazon triplicou a contagem de servidores CPU ano a ano. Ainda assim esgotou o estoque. [ref: amazons-cpu-crackdown-agentic-]

Ada

A SemiAnalysis reportou que Amazon e Microsoft venderam toda a capacidade de CPU para empresas de IA — incluindo OpenAI e Anthropic. A OpenAI portou toda a base de código para ARM para conseguir acesso às instâncias Graviton da AWS. Preços de CPU de servidor subiram 20 por cento desde março. Lead times para CPUs de alto número de cores chegaram a seis meses.

Alan

O custo composto é brutal. Um agente de código interno da própria Amazon gerou 1,8 milhão de dólares em custos de tokens em um mês — 860 por cento acima do orçamento de desenvolvimento. A escassez está concentrada em spot instances. Capacidade reservada e contratada não está em falta. Quem travou reserved instances antes do Q1 está protegido. Quem está em on-demand está competindo pelo que sobrou. [ref: amazons-cpu-crackdown-agentic-]

Alan

Terceiro choque: a camada de inferência. A OpenAI gastou 5,02 bilhões de dólares em inferência no Azure só na primeira metade de 2025. Em junho de 2026, a equipe de engenharia desenvolveu uma otimização puramente em software — sem novo hardware, sem reformulação arquitetural — que cortou o custo de inferência em mais de 50 por cento. [ref: how-openai-keeps-chatgpt-fast-]

Ada

O design que viabilizou o ganho: o harness agêntico em Rust trata todo o histórico visível ao modelo como append-only. Novas mensagens e resultados de ferramentas sempre no final, nunca inseridos antes. Ferramentas em ordem determinística. Políticas de aprovação aplicadas em tempo de execução. O prefixo estável entre turnos maximiza o cache hit rate entre requisições. E o preço da API codifica o incentivo: GPT-5.2 oferece 90 por cento de desconto em tokens de entrada cacheados — $1,75 por milhão no preço padrão. Não é elegância de engenharia. É economia aplicada a design. [ref: how-openai-keeps-chatgpt-fast-]

Alan

Martin Spier, que lidera performance do ChatGPT na OpenAI, colocou a escala do problema assim: se uma tarefa exige 30 requisições ao modelo, um segundo extra por requisição acumula em trinta segundos. Cortar trabalho repetido em toda a cadeia importa tanto quanto acelerar o modelo em isolamento. E métricas padrão de benchmark não capturam a forma dos traces agênticos — multi-turno, cauda pesada, interleaved com ferramentas.

Ada

A Databricks publicou esta semana um guia de gestão de custos para deployments de IA agêntica em escala organizacional, com dados e contribuições da Stripe, Coinbase, Uber e Ramp. O conceito central é a "fronteira de eficiência" — o conjunto de modelos com melhor custo por unidade de inteligência, distinto da fronteira de inteligência bruta que os labs perseguem. Essa fronteira se move rápido: a Stripe testou o Opus 4.7, constatou que não melhorava significativamente sobre o Opus 4.6 pelo custo maior, e bloqueou o rollout. A Databricks viu regressões de custo comparando Opus 5.0 ao 4.8. [ref: managing-ai-coding-costs-at-sc]

Alan

O resultado direto de ajustar harness e configurações de caching: quase 50 por cento de redução em tokens gerados sem degradação de qualidade observada para desenvolvedores. O Smart Router do Unity AI Gateway corta custo médio por tarefa em mais de 30 por cento. O erro mais comum no budget: hard caps por usuário bloqueiam os engenheiros produtivos rodando loops agênticos longos, enquanto ignoram o desperdício real — spawns acidentais de múltiplos agentes numa sexta à noite, retry loops que multiplicam custo dez vezes até a manhã seguinte. Na escala da Databricks, 500 a mil engenheiros atingiam limites duros mensalmente, inundando o canal interno de Slack com pedidos de desbloqueio. [ref: managing-ai-coding-costs-at-sc]

Ada

O recado pro CTO é objetivo: se o roadmap de agentes de 2026 não tem linha de caching, roteamento por complexidade de tarefa e planejamento de ratio CPU-por-GPU, você está financiando o roadmap do competidor. Não é hipérbole. É o custo composto de memória a preço de 2008, CPU em escassez estrutural, e tokens que multiplicam a cada hop agêntico.

Alan

Segundo bloco: agentes saindo do artesanal. Três movimentos desta semana mostram que a infraestrutura de agentes está virando commodity — e o diferencial competitivo migrou de camada.

Ada

Quem ainda está construindo com a spec de novembro do MCP tem uma dívida técnica mensurável em latência e custo de infra. Não é opinião.

Alan

Em 28 de julho de 2026, Google e Hugging Face co-lideraram a publicação da nova especificação do MCP sob o Agentic AI Foundation. É a maior mudança arquitetural do protocolo desde seu lançamento. O handshake initialize foi removido. O header Mcp-Session-Id foi removido. O protocolo agora é stateless: cada requisição carrega tudo que o servidor precisa para respondê-la, sem conexão prévia necessária. Os SDKs de TypeScript e Python cruzaram 1 bilhão de downloads cada antes da publicação. [ref: google-leads-mcp-spec-overhaul]

Ada

O problema anterior era concreto e caro. Três pods atrás de um load balancer: a segunda requisição de um cliente podia cair na máquina errada e retornar erro 400 Session Not Found. Os workarounds: sticky session rules que destruíam autoscaling, Redis stores adicionando uma leitura e uma escrita em cada tool call, inspeção de pacotes no gateway. O Hugging Face mediu: uma única tool call gerava mais de 100 mensagens de protocolo MCP sob a spec antiga. [ref: google-leads-mcp-spec-overhaul]

Alan

Com a nova spec: qualquer instância de servidor responde a qualquer requisição. Load balancers padrão de round-robin funcionam sem alteração. Servidores MCP rodam como funções serverless que escalam a zero quando ociosas. O GitHub MCP Server já removeu o Redis de armazenamento de sessão. A motivação do Google: o MCP Toolbox for Databases registrou mais de 20 milhões de tool calls em mais de 40 bancos de dados em um único mês — Redis round-trips e sticky routing são linha de custo visível nessa escala. [ref: google-leads-mcp-spec-overhaul]

Alan

No campo de aplicação, dois casos de produção mostram onde a linha está hoje. O Spotify lançou o Honk em fevereiro de 2025 — um agente rodando sobre Claude Code e a plataforma Fleet Management que gera mil pull requests merged a cada dez dias, em milhares de repositórios, sem engenheiro no loop até o PR passar em todos os testes. Mais de 1.500 PRs em produção. Economia de 60 a 90 por cento no tempo de migração. O caso foi apresentado no QCon London em março de 2026. [ref: spotify-deploys-autonomous-codebase-migration-agentcontinuous-refactoring-at-sca]

Ada

O que o caso do Spotify revela não é o modelo — é o que precisa existir antes do modelo. Catálogo de serviços confiável que mapeia ownership de cada componente. CI rigoroso o suficiente para pegar erros de IA. Sem esses pré-requisitos, automação autônoma em escala de frota não chega ao ar com segurança. O Spotify construiu essa fundação desde 2022. O modelo é uma camada trocável. A infra de governança não é. [ref: spotify-deploys-autonomous-codebase-migration-agentcontinuous-refactoring-at-sca]

Alan

E no SRE, a Instacart abriu o código do Blueberry esta semana — um agente de triagem de incidentes nativo do Slack. Em abril de 2026: 25 mil passes de diagnóstico em 270 canais, hipóteses de causa raiz em média em três minutos por alerta, dez subagentes lançados em paralelo a cada disparo — um para conhecimento interno, os demais coletando deploy history, feature flags, logs de erro e varreduras de anomalias simultaneamente. [ref: instacart-open-sources-blueberry-an-ai-assistant-for-faster-incident-triage]

Ada

O número que importa: acurácia diagnóstica foi do meio dos 60 por cento para a faixa dos 90 por cento depois de ancorar o sistema com 14 anos de histórico de incidentes da Instacart. 99,9 por cento de taxa de sucesso de workflow. 58 mil dispatches de ferramentas MCP em um único mês. O Blueberry gera hipóteses e evidências — toda decisão de remediação permanece com o engenheiro. Times sem corpus histórico estruturado vão começar na casa dos 60. O corpus não é um detalhe de implementação — é o que move o ponteiro. [ref: instacart-open-sources-blueberry-an-ai-assistant-for-faster-incident-triage]

Alan

O diferencial competitivo não é mais "temos agentes." É quais gates, qual protocolo, qual blast radius, qual corpus de histórico de incidentes. É isso que separa 90 por cento de acurácia de 62.

Alan

A semana fechou com uma conta objetiva: memória mais cara que em 2008, CPU em escassez estrutural, e tokens que multiplicam a cada hop agêntico. Quem vai dimensionar isso certo não está esperando o preço cair — está roteando, cacheando e travando capacidade reservada agora. Na Edition de sexta: o que a ByteDance quer com um modelo de dez trilhões de parâmetros, e por que o alvo declarado é a Anthropic. Boa semana.