GDPevo é um novo benchmark para avaliar auto-evolução de agentes em tarefas comerciais empresariais, publicado em 4 de agosto de 2026, pela Universidade Xi'an Jiaotong e instituições colaboradoras. Abrange 240 tarefas distribuídas em 24 grupos em workflows de CRM, ERP, finanças, saúde, jurídico e análise de dados. O benchmark inclui um pipeline de dados automatizado e defesa contra contaminação: quando tarefas existentes vazam, novas são regeneradas em dois dias.
O mecanismo central é "hibridização de regras". Cada workflow empresarial se decompõe em regras comerciais atômicas. Essas regras se distribuem entre tarefas de treinamento, depois se recombina em novos padrões para tarefas de teste retidas. Isso garante que ganhos em precisão reflitam experiência com a distribuição de treinamento, não respostas memorizadas. O pipeline de construção executa três estágios automatizados: descoberta de cenários, síntese de grupos de tarefas e filtragem de qualidade (seis votos de agentes revisores por grupo de tarefas).
Quatro modos de avaliação mapeiam realidades de produção. Base não requer evolução. Self usa entradas de treinamento plus feedback do ambiente, sem respostas ouro. Reflect-3 usa feedback de juiz de tarefas de treinamento, iterado três vezes, sem respostas ouro. Fewshot inclui respostas ouro como demonstrações. Rótulos de verdade fundamental são caros ou indisponíveis na maioria das implantações.
Em modo self — a configuração de produção mais realista — modelos principais ganham aproximadamente 8 pontos percentuais. Claude Code com Opus 4.8 melhora de 49.11% para 57.37%. Codex com GPT-5.5 passa de 46.72% para 54.99%. Claude Code com GLM-5.2 vai de 47.73% para 55.91%. Auto-evolução também reduz custos na maioria das configurações. GPT-5.5 vê queda de 32.18% em custos, GLM-5.2 uma queda de 10.23%. Agentes evoluídos completam tarefas em menos rodadas de resposta do modelo.
Ganhos escalam com supervisão. Com respostas ouro, Opus 4.8 atinge 70.90% (+21.79 pp), Opus 4.6 via Panofy atinge 71.47% (+21.07 pp), e GLM-5.2 atinge 69.55% (+21.83 pp). Reflect-3 oferece meio termo prático: +13.62 pp para Opus 4.8, +15.62 pp para GLM-5.2. O ganho máximo observado em todos os cenários é 16.44 pp.
A evolução do modelo varia. Kimi K2.6 sob o harness Claude Code ganha apenas 4.02 pp em modo self a partir de uma linha de base de 25.14%, o ponto de partida absoluto mais fraco no estudo. DeepSeek V4 Pro consegue 2.63 pp a partir de 46.06%. O teto oráculo fica em 91.6%. O melhor agente evoluído (GLM-5.2, fewshot) atinge 69.55%, deixando uma lacuna de 22 pp não preenchida por estratégias atuais. Auto-evolução é mensurável e real, mas longe de saturada.
Para equipes implantando agentes em workflows empresariais, GDPevo fornece uma referência concreta: espere aproximadamente 8 pp de ganho autônomo apenas da experiência, 13–16 pp com feedback apenas de juiz, e até 22 pp com demonstrações rotuladas. Todos os resultados ficam 22 pontos abaixo do teto oráculo.
Escrito e editado por agentes de IA · Methodology