Together AI executou 904 rollouts—452 por modelo, quatro tentativas em cada uma das 113 tarefas DeepSWE—comparando GLM-5.3 e GPT-5.6 Sol em um benchmark de codificação projetado para colocar à prova engenharia de software real em várias linguagens e domínios. Uma cascata de dois estágios executando GLM-5.3 primeiro e escalando para Sol em falha de teste resolve 85,9% das tarefas a $6,61 por rollout. Sol sozinho resolve 72,7% a $8,37. A cascata supera Sol de modelo único por 13,2 pontos percentuais e custa 21% menos.

No pass@1, Sol lidera 72,7% para GLM-5.3's 69,0%—uma diferença de 3,7 pontos dentro do ruído estatístico. Pass@2 inverte a ordem: GLM-5.3 atinge 81,1%, Sol 81,0%. No pass@4, GLM-5.3 se afasta com 87,6% versus 85,8%. A diferença de custo é mais acentuada. GLM-5.3 executa a $3,99 por rollout, Sol $8,37—uma diferença de 2,1x. Por $100 de gastos, GLM-5.3 resolve 17 tarefas; Sol resolve 9.

A latência corta do outro lado. Sol completa um rollout em 19 minutos em 61 etapas com 60k tokens de saída. GLM-5.3 leva 35 minutos, 124 etapas e 80k tokens. Para fluxos de trabalho síncronos com intervenção humana, a diferença de latência justifica o custo de Sol. Para pipelines em lote e agentes offline, o tempo extra é irrelevante e o custo domina.

Os modos de falha mostram onde a decisão de roteamento se torna operacional. Sol quebra a suite de testes existente do repositório em 20% das falhas—a assinatura de regressão em toda a família GPT. GLM-5.3 quebra em 11%. Quando GLM-5.3 falha, ele perde para frente: uma taxa de quase acerto de 61% versus 54% de Sol. Qualquer pipeline aceitando diffs de Sol precisa de um portão de regressão completo. GLM-5.3 precisa disso menos.

Os modelos se dividem claramente por domínio e linguagem. Sol vence em modelagem de dados e serialização (92%), ferramentas de build e ops (73%), concorrência (72%) e conformidade de protocolo (59%). GLM-5.3 vence em linguagens de query e config (88%), internals de linguagem (83%), reatividade com estado (73%) e JavaScript (90% versus 75%) e Rust (70% versus 60%). Sol leva Python (74% para 66%), Go (79% para 76%) e TypeScript (66% para 61%). O ponto fraco claro de GLM-5.3 é conformidade de protocolo em 44%, 15 pontos abaixo de Sol.

A cascata funciona porque os modelos discordam substancialmente. A correlação por tarefa é 0,43. Ambos resolvem 90 tarefas. GLM-5.3 resolve exclusivamente 9 que Sol nunca alcança; Sol resolve exclusivamente 7 que GLM-5.3 perde; 7 derrotam ambos. Sua união cobre 106 de 113 tarefas (93,8%). Baixa correlação significa que escalação roteia para Sol apenas onde GLM-5.3 genuinamente falha, não duplicando trabalho.

A árvore de decisão do arquiteto é direta. Padrão para GLM-5.3 para cargas de trabalho em lote e repositórios com JavaScript/Rust intensivo. Rotear para Sol quando a latência é visível ao usuário, quando a tarefa é conformidade de protocolo ou infraestrutura de sistemas, ou ao trabalhar em Python, Go ou TypeScript em escala. Executar a cascata se sua carga de trabalho abrange domínios sem premissa prévia em tarefas difíceis. Colocar uma suite de regressão ao redor dos diffs de Sol independentemente; pule-a para GLM-5.3 e você estará principalmente certo.

A camada de peso aberto fechou para dentro de 3,7 pontos pass@1 do líder da fronteira em um benchmark de codificação difícil, a 2,1x menor custo, com melhor precisão por dólar em configurações de múltiplas tentativas. A questão de modelo único é menos interessante do que seis meses atrás. A questão de roteamento é onde os ganhos de eficiência vivem agora.