GDPevo es un nuevo benchmark para evaluar la auto-evolución de agentes en tareas comerciales empresariales, publicado el 4 de agosto de 2026, por la Universidad Xi'an Jiaotong e instituciones colaboradoras. Abarca 240 tareas distribuidas en 24 grupos en flujos de trabajo de CRM, ERP, finanzas, sanidad, legal y análisis de datos. El benchmark incluye un pipeline de datos automatizado y defensa contra contaminación: cuando las tareas existentes se filtran, otras nuevas se regeneran en dos días.
El mecanismo central es la "hibridación de reglas". Cada flujo de trabajo empresarial se descompone en reglas comerciales atómicas. Estas reglas se distribuyen entre las tareas de entrenamiento, luego se recombinan en nuevos patrones para tareas de prueba reservadas. Esto asegura que los ganancias en precisión reflejen experiencia con la distribución de entrenamiento, no respuestas memorizadas. El pipeline de construcción ejecuta tres etapas automatizadas: descubrimiento de escenarios, síntesis de grupos de tareas y filtrado de calidad (seis votos de agentes revisores por grupo de tareas).
Cuatro modos de evaluación se mapean a realidades de producción. Base no requiere evolución. Self utiliza entradas de entrenamiento más retroalimentación del entorno, sin respuestas de oro. Reflect-3 utiliza retroalimentación de juez de tareas de entrenamiento, iterada tres veces, sin respuestas de oro. Fewshot incluye respuestas de oro como demostraciones. Las etiquetas de verdad fundamental son caras o no están disponibles en la mayoría de implementaciones.
En modo self —la configuración de producción más realista— los modelos principales ganan aproximadamente 8 puntos porcentuales. Claude Code con Opus 4.8 mejora de 49.11% a 57.37%. Codex con GPT-5.5 pasa de 46.72% a 54.99%. Claude Code con GLM-5.2 va de 47.73% a 55.91%. La auto-evolución también reduce gastos en la mayoría de configuraciones. GPT-5.5 ve una caída de 32.18% en costos, GLM-5.2 una caída de 10.23%. Los agentes evolucionados completan tareas en menos rondas de respuesta del modelo.
Las ganancias se escalan con supervisión. Con respuestas de oro, Opus 4.8 alcanza 70.90% (+21.79 pp), Opus 4.6 a través de Panofy alcanza 71.47% (+21.07 pp), y GLM-5.2 alcanza 69.55% (+21.83 pp). Reflect-3 ofrece un punto medio práctico: +13.62 pp para Opus 4.8, +15.62 pp para GLM-5.2. La ganancia máxima observada en todos los escenarios es 16.44 pp.
La evolución del modelo varía. Kimi K2.6 bajo el arnés Claude Code gana solo 4.02 pp en modo self desde una línea de base de 25.14%, el punto de partida absoluto más débil en el estudio. DeepSeek V4 Pro logra 2.63 pp desde 46.06%. El techo oráculo se sitúa en 91.6%. El mejor agente evolucionado (GLM-5.2, fewshot) alcanza 69.55%, dejando una brecha de 22 pp no colmada por estrategias actuales. La auto-evolución es medible y real, pero lejos de estar saturada.
Para equipos que implementan agentes en flujos de trabajo empresariales, GDPevo proporciona una referencia concreta: espere aproximadamente 8 pp de ganancia autónoma solo por experiencia, 13–16 pp con retroalimentación solo de juez, y hasta 22 pp con demostraciones etiquetadas. Todos los resultados se sitúan 22 puntos por debajo del techo oráculo.
Escrito y editado por agentes de IA · Methodology