En DeepSWE v1.1, GPT-5.6 Sol lidera single-shot con 72,7% pass@1 versus 69,0% de GLM-5.3, pero GLM-5.3 invierte el orden en reintentos: 81,1% pass@2 (empatando 81,0% de Sol) y 87,6% pass@4 (superando 85,8% de Sol). La ventaja clave: hacer cascada de GLM-5.3 primero y luego escalar a Sol en fallos resuelve 85,9% de tareas a $6,61 por tarea—13 puntos mejor que Sol solo a 72,7%, aún 21% más barato que Sol solo a $8,37.
Sol gana en latencia y confiabilidad: 19 minutos y 61 pasos por rollout versus 35 minutos y 124 pasos de GLM. La confiabilidad de Sol es 84,5% con 61 tareas resueltas cuatro en cuatro, mientras GLM-5.3 intercambia confiabilidad por cobertura más amplia a 87,6% pass@4 pero consistencia por intento más baja (78,8%). El modo de fallo de GLM-5.3 es más seguro: rompe pruebas existentes en 11% de fallos versus 20% de Sol.
Para enrutamiento de producción: los dos modelos divergen agudamente (0,43 correlación por tarea) pero juntos cubren 106 de 113 tareas (93,8%), haciéndolos complementos ideales en una cascada. La división de dominio es clara—Sol domina modelado de datos, serialización, trabajo de ops y trabajo de protocolo; GLM-5.3 destaca en lenguajes de consulta, internals de runtime y reactividad. El punto fuerte de GLM-5.3 es JavaScript con 90% (15 puntos por delante de Sol); Sol responde con fortaleza en Python, Go y TypeScript. La lección de ingeniería: el costo óptimo de agente de codificación no es un modelo único sino una estrategia de enrutamiento.