aiexpert
Início / Notícias / Nota
Research · 22 de ago. de 2026, 06:36 · 4 fontes

Cascata GLM-5.3 + GPT-5.6 Sol: taxa de resolução de 85,9%, 21% mais barato que Sol sozinho

Em DeepSWE v1.1, GPT-5.6 Sol lidera single-shot com 72,7% pass@1 versus 69,0% de GLM-5.3, mas GLM-5.3 inverte a ordem em retentativas: 81,1% pass@2 (empatando Sol's 81,0%) e 87,6% pass@4 (superando Sol's 85,8%). A vantagem chave: cascatear GLM-5.3 primeiro e depois escalar para Sol em falhas resolve 85,9% das tarefas a $6,61 por tarefa—13 pontos melhor que Sol sozinho a 72,7%, ainda 21% mais barato que Sol sozinho a $8,37.

Sol vence em latência e confiabilidade: 19 minutos e 61 passos por rollout versus 35 minutos e 124 passos do GLM. A confiabilidade de Sol fica em 84,5% com 61 tarefas resolvidas quatro em quatro, enquanto GLM-5.3 troca confiabilidade por cobertura mais ampla em 87,6% pass@4 mas consistibilidade por tentativa mais baixa (78,8%). O modo de falha do GLM-5.3 é mais seguro: quebra testes existentes em 11% de falhas versus 20% do Sol.

Para roteamento de produção: os dois modelos divergem nitidamente (0,43 correlação por tarefa) ainda cobrem junto 106 de 113 tarefas (93,8%), tornando-os ideais complementos em uma cascata. Divisão de domínio é limpa—Sol domina modelagem de dados, serialização, trabalho de ops e trabalho de protocolo; GLM-5.3 se destaca em linguagens de consulta, internals de runtime, e reatividade. O ponto forte de GLM-5.3 é JavaScript em 90% (15 pontos à frente de Sol); Sol responde com força Python, Go e TypeScript. A lição de engenharia: custo ótimo de agente de codificação não é um modelo único mas uma estratégia de roteamento.

Fontes

Tudo que sustenta esta nota
  1. 01 Primary source together.ai
  2. 02 together.ai together.ai “Run GLM-5.3 first, escalate to GPT-5.6 Sol when the tests fail. That cascade solves 85.9% of DeepSWE tasks at $6.61 each. Sol alone solves 72.7% at $8.37. Thirteen points better, 21% cheaper”
  3. 03 together.ai together.ai “At $3.99 a rollout, GLM-5.3 is 2.1x cheaper than Sol ($8.37), which in value terms is 17 solves per $100 against Sol's 9”
  4. 04 together.ai together.ai “Per-task correlation is 0.43, real disagreement for two models this close on aggregate. They both solve 90 tasks; GLM-5.3 alone gets 9, Sol alone gets 7, and 7 defeat both. Their union covers 106 of 113 tasks (93.8%)”