Em DeepSWE v1.1, GPT-5.6 Sol lidera single-shot com 72,7% pass@1 versus 69,0% de GLM-5.3, mas GLM-5.3 inverte a ordem em retentativas: 81,1% pass@2 (empatando Sol's 81,0%) e 87,6% pass@4 (superando Sol's 85,8%). A vantagem chave: cascatear GLM-5.3 primeiro e depois escalar para Sol em falhas resolve 85,9% das tarefas a $6,61 por tarefa—13 pontos melhor que Sol sozinho a 72,7%, ainda 21% mais barato que Sol sozinho a $8,37.
Sol vence em latência e confiabilidade: 19 minutos e 61 passos por rollout versus 35 minutos e 124 passos do GLM. A confiabilidade de Sol fica em 84,5% com 61 tarefas resolvidas quatro em quatro, enquanto GLM-5.3 troca confiabilidade por cobertura mais ampla em 87,6% pass@4 mas consistibilidade por tentativa mais baixa (78,8%). O modo de falha do GLM-5.3 é mais seguro: quebra testes existentes em 11% de falhas versus 20% do Sol.
Para roteamento de produção: os dois modelos divergem nitidamente (0,43 correlação por tarefa) ainda cobrem junto 106 de 113 tarefas (93,8%), tornando-os ideais complementos em uma cascata. Divisão de domínio é limpa—Sol domina modelagem de dados, serialização, trabalho de ops e trabalho de protocolo; GLM-5.3 se destaca em linguagens de consulta, internals de runtime, e reatividade. O ponto forte de GLM-5.3 é JavaScript em 90% (15 pontos à frente de Sol); Sol responde com força Python, Go e TypeScript. A lição de engenharia: custo ótimo de agente de codificação não é um modelo único mas uma estratégia de roteamento.