Ora, una startup de 16 personas que mide la preparación de agentes web para clientes empresariales, publicó resultados de benchmark comparando seis arneses de agentes—Claude Code, ChatGPT, Gemini, Hermes, OpenClaw y eve de Vercel—contra sitios de producción real. Las métricas son operativas: costo por recorrido, latencia, conteo de pasos y tasa de finalización de tareas nativas, capturadas en cientos de flujos de trabajo reales de clientes.
La metodología impone una restricción crítica. Como ninguno de los dos arneses expone pasos de forma idéntica, Ora ejecuta un runtime separado para cada uno y rastrea cada paso. Ido Finder, líder de ingeniería, explica: sin rastreos por paso, una puntuación de benchmark es vacía. Cuando un agente falla en un flujo de suscripción, los clientes ven exactamente qué paso se rompió y qué intentó el agente. Ese rastreo es el producto.
Eve versus Claude Code produjo diferenciales concretos. Ejecutando ambos arneses en Claude Fable 5 y Haiku 4.5 contra tareas de integración idénticas en sitios de clientes, Ora midió: eve completó tarefas en 7% menos pasos, logró 2x éxito nativo (finalizando en el sitio del cliente versus alternativa de búsqueda web) y encontró 9% más endpoints válidos. Una ejecución detectó un bug de almacenamiento en caché de indicaciones en eve. Vercel lanzó una solución dentro de la ventana de pruebas. La siguiente ronda mostró aproximadamente 15% menos costo total.
Este ciclo de retroalimentación importa a los arquitectos. Ora se asocia con Vercel, dando al equipo de eve acceso directo a los datos de rastreo de Ora. El error surgió no de pruebas unitarias, sino de ejecuciones de comparación entre arneses en recorridos representativos de producción. La reducción de costos siguió directamente.
Después de publicar los resultados, Ora decidió construir su propia capa de agente en eve—una señal significativa de un equipo cuyo negocio es ejecutar todos los demás arneses uno al lado del otro. Motivo técnico: anulación de sandbox de eve. Eve viene con su propio entorno de ejecución aislado, que normalmente se ejecuta fuera del rastreo instrumentado de Ora. La anulación permite que Ora intercambie su propio entorno, para que los agentes de eve obtengan el mismo registro por paso que otros arneses sin necesidad de infraestructura nueva. journey.ora.ai ahora abarca ambos: eve es un arnés bajo prueba y el marco en el que se ejecuta la plataforma.
El patrón de implementación muestra presión de escala. Dieciséis ingenieros envían cientos de commits diariamente. Los agentes de codificación manejan tareas rutinarias de infraestructura—lectura de registros, implementación, actualización de variables de entorno. Finder estima el tiempo ahorrado en algunas horas a la semana. Consolidar front-end, back-end y runtime de agente en una única implementación de Vercel permite que los agentes de codificación razonen sobre una superficie de infraestructura unificada en lugar de coser sistemas separados.
Por la medida de Ora, el 99% de la web no puede manejar un agente que se suscribe, se integra y paga. Esa cifra impulsa el argumento de venta de Ora—la plataforma muestra a las empresas dónde fallan los agentes y qué corregir. Ora ahora se está dividiendo en microservicios en Vercel, con agentes eve internos ejecutándose como un servicio más en el gráfico.
Lección para arquitectos: la elección de arnés no es la elección de modelo. Claude Fable 5 se ejecutó dentro de eve y Claude Code en este benchmark. El arnés produjo diferencias medibles en conteo de pasos, validez de endpoint y costo. Sin aislar el arnés del modelo en sus evaluaciones, no sabe qué palanca está tirando.