Um estudo de UC Berkeley e Arena Intelligence quantifica quanto o próprio harness de avaliação influencia o desempenho de agentes de código, isolando efeitos do harness da capacidade do modelo. Os pesquisadores avaliaram 21 pares modelo–harness abrangendo sete modelos (Claude Fable 5, Claude Opus 4.8, Claude Sonnet 4.6, Claude Haiku 4.5, GPT-5.6 Sol, GPT-5.6 Luna e Kimi K3) e três harnesses—Claude Code, Codex CLI e Pi—em SWE-bench Lite e Terminal-Bench 2.0. A descoberta mais relevante para arquitetos: a escolha de harness pode gerar uma diferença de custo de 5x enquanto as taxas de sucesso permanecem quase planas.

O estudo revela que o mesmo modelo frequentemente alcança taxas de sucesso similares a custos substancialmente diferentes. Claude Fable 5, por exemplo, resolve 97.8% das tentativas em Claude Code, 96.7% em Codex e 96.7% em Pi, mas Claude Code custa cerca de duas vezes mais que Pi ($1.33 versus $0.67 por rollout). Entre modelos compartilhados em SWE-bench Lite, Claude Code custa cerca de 2.0x mais que Pi e 1.6x mais que Codex, usando médias geométricas de razões de custo. Enquanto isso, o efeito médio do harness na taxa de sucesso permanece dentro de ±2% em SWE-bench Lite e dentro de cerca de ±5% em Terminal-Bench 2.0. Os pesquisadores chamam essa diferença de custo oculta de "harness tax"—pagando extra por essencialmente a mesma qualidade por causa apenas da escolha do harness.

A diferença de custo origina-se no próprio design do harness. O contexto inicial médio de Claude Code é mais de 10x o de Pi, com instruções mais longas e schemas de ferramentas maiores. Para Claude Fable 5 em SWE-bench Lite, Pi e Claude Code fazem média de 15.4 e 15.3 turnos por tentativa respectivamente, mas Claude Code gasta cerca de duas vezes mais por turno. Pi atinge a fronteira de Pareto em ambos os benchmarks fornecendo apenas quatro ferramentas: read, write, edit e bash. Isso demonstra que um harness mínimo e open-source pode ser competitivo tanto em custo quanto em taxa de sucesso da tarefa, abrindo oportunidades para pesquisa de harness sem acesso a sistemas proprietários ou co-treinamento com modelos.

Uma segunda descoberta desafia a suposição de que modelos funcionam melhor com seu próprio harness. Entre seis modelos Anthropic e OpenAI e ambos os benchmarks, um harness alternativo alcança a taxa de sucesso mais alta observada em nove de doze comparações. Claude Sonnet 4.6 resolve 68.9% das tentativas em Codex versus 66.7% em Claude Code em SWE-bench Lite a custo similar. GPT-5.6 Sol, que OpenAI descreve como otimizado para engenharia de software agentic em Codex, alcança uma taxa de sucesso de 83.3% em Pi versus 78.9% em Codex em Terminal-Bench 2.0, a cerca de metade do custo ($0.42 versus $0.76). Esses resultados mostram que as capacidades de um modelo são compatíveis e generalizáveis entre harnesses, e que a otimização do provedor não garante o melhor pareamento.

O estudo é limitado a dois benchmarks open-source que modelos podem ter encontrado durante o treinamento, e os resultados podem diferir em outros benchmarks e workloads. Os pesquisadores observam que a seleção de harness torna-se mais urgente para agentes de código dada a volume e dispersão de seu uso, e que o próximo passo natural é avaliar harnesses e automatizar sua seleção em fluxos de desenvolvimento reais onde requisitos evoluem e tarefas se estendem entre sessões.

Para arquitetos construindo ou comparando frameworks de avaliação de agentes, o aprendizado é direto: meça custo e taxa de sucesso entre harnesses para o mesmo modelo, porque o design do harness pode dominar o sinal que você está medindo e esconder diferenças de custo substanciais atrás de sucesso de tarefa similar.