O harness, não o modelo, decide se um agente é seguro e barato de rodar
Setenta e duas horas foi o tempo entre encontrar um heap overflow numa biblioteca de imagem e abrir um pull request nos repositórios internos da OpenAI. [ref: heap-overflow-and-sso-misconfiguration-compromised-openai-internal-repos]
A mesma falha ainda mora no Slack, na Meta e no GitHub Enterprise. [ref: heap-overflow-and-sso-misconfiguration-compromised-openai-internal-repos]
Este é o ai|expert Wire. Esta semana, o harness — não o modelo — decide se um agente é seguro e barato de rodar.
O ataque começou num fórum de upload de imagens e terminou num pull request no monorepo interno da OpenAI. Um heap overflow não documentado em libheif, encadeado a uma falha de configuração de SSO, deu a pesquisadores acesso a contas de funcionários da OpenAI. [ref: heap-overflow-and-sso-misconfiguration-compromised-openai-internal-repos]
A OpenAI pagou seis mil e quinhentos dólares de recompensa — e a mesma vulnerabilidade em libheif atravessa Slack, Meta, GitHub Enterprise e frameworks como Next.js e Astro. [ref: heap-overflow-and-sso-misconfiguration-compromised-openai-internal-repos]
E não é só a superfície de imagem. Um ataque separado, chamado A2M, sequestra agentes MCP envenenando os metadados das próprias ferramentas — noventa e três vírgula seis por cento de taxa de invocação maliciosa no GLM-4.6. [ref: a2m-trace-optimized-agent-hijacking-in-the-mcp-ecosystem]
Isso não mexe no modelo. Mexe em como o agente decide qual ferramenta chamar — e esse é exatamente o ponto cego que ninguém audita.
É o mesmo ponto que Vinoth Govindarajan, da OpenAI, levanta no framework de confiabilidade que ele apresentou em setembro: a falha não mora no modelo, mora no harness — em quem possui o estado, quem serializa as mutações concorrentes, quem valida na borda visível ao usuário. [ref: the-agent-harness-control-planes-invariants-and-approval-boundaries-for-producti]
E ainda assim a própria OpenAI lançou a nova API de agentes travada em residência de dados só nos Estados Unidos, sem Zero Data Retention — nem sandbox self-hosted resolve isso. [ref: openai-agents-api]
Ou seja: harness certo não compensa jurisdição errada.
Se a segurança do agente já é decidida no harness, o custo dele também é — e essa conta está caindo sobre quem sustenta a infraestrutura por trás do código que os agentes escrevem.
A Linear viu o CI virar gargalo assim que os agentes aceleraram o ritmo de código. A suíte de testes quase quadruplicou desde o início de 2026, e o tempo de espera por PR caiu de mais de seis minutos para pouco mais de cinco. [ref: ai-coding-made-ci-a-bottleneck-linear-reworked-theirs-to-keep-up]
Isso exigiu reescrever o pipeline inteiro — infraestrutura, dependência entre jobs, overhead de setup — como sistema, não como otimização isolada. [ref: ai-coding-made-ci-a-bottleneck-linear-reworked-theirs-to-keep-up]
E a escolha do harness multiplica essa conta antes mesmo de chegar no CI. Um estudo da UC Berkeley com a Arena Intelligence testou vinte e um pares de modelo e harness e achou uma diferença de custo de cinco vezes com taxas de sucesso praticamente iguais. [ref: harnesstax-how-much-does-the-harness-matter-for-coding-agents]
Claude Code custa o dobro do que Pi nos mesmos modelos — noventa e sete vírgula oito por cento contra noventa e seis vírgula sete por cento de sucesso. [ref: harnesstax-how-much-does-the-harness-matter-for-coding-agents]
E isso quebra a premissa de que o harness do próprio provedor é sempre a melhor escolha: em nove de doze comparações, um harness alternativo venceu o modelo em sua própria casa. [ref: harnesstax-how-much-does-the-harness-matter-for-coding-agents]
A Cloudflare está atacando o mesmo problema em duas frentes. Worker Previews dá a cada branch seu próprio namespace de Durable Objects e Container, então uma mudança de agente nunca toca produção antes de ser testada isoladamente. [ref: cloudflare-worker-previews-isolated-environments-for-agent-changes]
E numa camada mais baixa, cortar noventa por cento dos pontos de hash no consistent hashing devolveu cem terabytes de RAM — porque os últimos noventa mil hashes por servidor reduziam o erro em só zero vírgula sete por cento. [ref: cloudflare-saved-100tb-of-ram-through-algorithmic-optimization-in-rust]
É o mesmo padrão do bloco anterior: ninguém está economizando no modelo. Estão economizando — ou perdendo — na camada que sustenta o modelo.
O modelo ficou barato de testar e caro de sustentar — e essa inversão é a história da semana. A Edition de sexta traz o balanço completo e o que cada escolha de harness realmente custa em produção. Bom fim de semana.