Un estudio de UC Berkeley y Arena Intelligence cuantifica cuánto el harness de evaluación en sí mismo influye en el desempeño de agentes de código, aislando los efectos del harness de la capacidad del modelo. Los investigadores evaluaron 21 pares modelo-harness abarcando siete modelos (Claude Fable 5, Claude Opus 4.8, Claude Sonnet 4.6, Claude Haiku 4.5, GPT-5.6 Sol, GPT-5.6 Luna, y Kimi K3) y tres harnesses—Claude Code, Codex CLI, y Pi—en SWE-bench Lite y Terminal-Bench 2.0. El hallazgo más importante para los arquitectos: la elección de harness puede generar una diferencia de costo de 5x mientras las tasas de éxito se mantienen casi planas.

El estudio revela que el mismo modelo a menudo logra tasas de éxito similares a costos sustancialmente diferentes. Claude Fable 5, por ejemplo, resuelve el 97.8% de intentos en Claude Code, 96.7% en Codex, y 96.7% en Pi, pero Claude Code cuesta aproximadamente el doble que Pi ($1.33 versus $0.67 por rollout). En modelos compartidos en SWE-bench Lite, Claude Code cuesta aproximadamente 2.0x más que Pi y 1.6x más que Codex, usando medias geométricas de ratios de costo. Mientras tanto, el efecto promedio del harness en la tasa de éxito se mantiene dentro de ±2% en SWE-bench Lite y dentro de aproximadamente ±5% en Terminal-Bench 2.0. Los investigadores llaman a esta diferencia de costo oculta el "harness tax"—pagar extra por esencialmente la misma calidad debido únicamente a la elección del harness.

La brecha de costo se origina en el diseño del harness en sí. El contexto inicial promedio de Claude Code es más de 10x el de Pi, con instrucciones más largas y esquemas de herramientas más grandes. Para Claude Fable 5 en SWE-bench Lite, Pi y Claude Code promedian 15.4 y 15.3 turnos por intento respectivamente, pero Claude Code gasta aproximadamente el doble por turno. Pi alcanza la frontera de Pareto en ambos benchmarks al proporcionar solo cuatro herramientas: read, write, edit, y bash. Esto demuestra que un harness mínimo de código abierto puede ser competitivo tanto en costo como en tasa de éxito de tareas, abriendo oportunidades para investigación de harness sin acceso a sistemas propietarios o co-entrenamiento con modelos.

Un segundo hallazgo desafía la suposición de que los modelos funcionan mejor con su propio harness. En seis modelos de Anthropic y OpenAI y ambos benchmarks, un harness alternativo logra la tasa de éxito más alta observada en nueve de doce comparaciones. Claude Sonnet 4.6 resuelve el 68.9% de intentos en Codex versus 66.7% en Claude Code en SWE-bench Lite a costo similar. GPT-5.6 Sol, que OpenAI describe como optimizado para ingeniería de software agéntica en Codex, logra una tasa de éxito del 83.3% en Pi versus 78.9% en Codex en Terminal-Bench 2.0, a aproximadamente la mitad del costo ($0.42 versus $0.76). Estos resultados muestran que las capacidades de un modelo son compatibles y generalizables entre harnesses, y que la optimización del proveedor no garantiza el mejor emparejamiento.

El estudio se limita a dos benchmarks de código abierto que los modelos pueden haber encontrado durante el entrenamiento, y los resultados pueden diferir en otros benchmarks y cargas de trabajo. Los investigadores señalan que la selección de harness se vuelve más apremiante para agentes de código dada la volumen y dispersión de su uso, y que el siguiente paso natural es evaluar harnesses y automatizar su selección en flujos de trabajo de desarrollo real donde los requisitos evolucionan y las tareas se extienden entre sesiones.

Para arquitectos que construyen o comparan frameworks de evaluación de agentes, la conclusión es directa: mide costo y tasa de éxito entre harnesses para el mismo modelo, porque el diseño del harness puede dominar la señal que estás midiendo y ocultar diferencias de costo sustanciales detrás de éxito de tareas similar.