Un nuevo benchmark publicado ayer aísla un modo de fallo que las evaluaciones estándar de agentes de código han estado ocultando a la vista: la brecha entre lo que un LLM genera y lo que el shell realmente ejecuta. QuoteBench, de investigadores de LMU Munich y la Universidad de Zhejiang, prueba 56 tareas Bash de un solo intento en 14 familias derivadas de incidentes en ocho configuraciones de harness. Un analizador intencionalmente sin escape entre generación y ejecución reduce el éxito de tareas en 55,4 a 73,2 puntos porcentuales según la configuración.
El artículo distingue tres componentes: el contrato de generación (lo que emite el modelo), el transporte de ejecución (cómo el harness serializa, encapsula y reparsea esa salida) y el validador de estado final (si la evaluación verifica el estado real del sistema de archivos o solo cadenas coincidentes). Los benchmarks actuales colapsan los tres. Una "puntuación coincidente" te dice si el comando se veía correcto; no te dice si el mismo comando sobrevive en una ruta de ejecución real. QuoteBench introduce un analizador sin escape que representa las capas de serialización comunes en marcos de trabajo de agentes — encapsulamiento JSON, manejo de cadenas de subprocess, transporte MCP — y mide qué sucede con cada tarea cuando la misma respuesta del modelo la atraviesa.
Los resultados exponen dos fenómenos separados. Primero, daño: el analizador sin escape por sí solo representa 55,4 a 73,2 puntos porcentuales de pérdida de éxito de tareas sin cambiar un solo carácter de la generación del modelo. Segundo, compensación: cuando se informa a los modelos sobre el límite de ejecución, adaptan su estilo de generación y recuperan 30,4 a 60,7 puntos porcentuales en seis de las ocho configuraciones — pero cero o ligeramente negativo en las otras dos. Algunas combinaciones harness-modelo no pueden adaptarse en absoluto, incluso con divulgación explícita de prompt.
GPT-5.6-sol expone esta estructura oculta. Su brecha coincidente — el número titular que un benchmark convencional reportaría — es −3,6 puntos porcentuales. La contabilidad subyacente de QuoteBench: −64,3 puntos de daño del analizador y +60,7 puntos de compensación del cambio de generación del modelo. La puntuación coincidente es aritméticamente correcta y operacionalmente sin sentido. Un equipo que eligió GPT-5.6-sol porque se veía casi igual al resto del campo en una tabla de clasificación de puntuación coincidente está ejecutando un modelo que depende de 60,7 puntos porcentuales de auto-corrección solo para mantenerse competitivo en esa configuración.
La inestabilidad de clasificación importa para la selección de modelos. En 26 pares de modelos comparables, la configuración de deployment produce una reversión de modelo inequívoca y cuatro más que se encuentran en márgenes de tarea única. Si elegiste un modelo de una tabla de clasificación de puntuación coincidente y luego lo implementaste a través de un harness con diferentes semánticas de serialización, podrías estar ejecutando un modelo subóptimo para tu stack — y no lo sabrías por el número del benchmark.
La implicación de CI/CD en producción es directa. Los equipos que ejecutan agentes de código en pipelines desatendidos — el modo --auto-exec que investigadores de seguridad han documentado como el patrón de deployment del mundo real dominante — no tienen mecanismo de divulgación. El modelo no recibe información sobre el transporte de ejecución, se sitúa en la zona de compensación del peor caso, y el validador de estado final en la mayoría de las evaluaciones nunca verifica si el sistema de archivos terminó en el estado correcto.
El artículo de QuoteBench recomienda un requisito de divulgación, no una clasificación de modelos: cualquier evaluación de agente de código debe reportar configuración del modelo, contrato de generación, ruta de ejecución, punto de operación y un validador de estado final. Una única puntuación coincidente no es una propiedad intrínseca del modelo. Es una propiedad de un par específico modelo-harness, y el harness es la mitad del sistema que se envía a tus ejecutores CI.