aiexpert
Inicio / Noticias / Nota
Research · 22 ago 2026, 06:36 · 4 fuentes

Cascada GLM-5.3 + GPT-5.6 Sol: tasa de resolución 85,9%, 21% más barato que Sol solo

En DeepSWE v1.1, GPT-5.6 Sol lidera single-shot con 72,7% pass@1 versus 69,0% de GLM-5.3, pero GLM-5.3 invierte el orden en reintentos: 81,1% pass@2 (empatando 81,0% de Sol) y 87,6% pass@4 (superando 85,8% de Sol). La ventaja clave: hacer cascada de GLM-5.3 primero y luego escalar a Sol en fallos resuelve 85,9% de tareas a $6,61 por tarea—13 puntos mejor que Sol solo a 72,7%, aún 21% más barato que Sol solo a $8,37.

Sol gana en latencia y confiabilidad: 19 minutos y 61 pasos por rollout versus 35 minutos y 124 pasos de GLM. La confiabilidad de Sol es 84,5% con 61 tareas resueltas cuatro en cuatro, mientras GLM-5.3 intercambia confiabilidad por cobertura más amplia a 87,6% pass@4 pero consistencia por intento más baja (78,8%). El modo de fallo de GLM-5.3 es más seguro: rompe pruebas existentes en 11% de fallos versus 20% de Sol.

Para enrutamiento de producción: los dos modelos divergen agudamente (0,43 correlación por tarea) pero juntos cubren 106 de 113 tareas (93,8%), haciéndolos complementos ideales en una cascada. La división de dominio es clara—Sol domina modelado de datos, serialización, trabajo de ops y trabajo de protocolo; GLM-5.3 destaca en lenguajes de consulta, internals de runtime y reactividad. El punto fuerte de GLM-5.3 es JavaScript con 90% (15 puntos por delante de Sol); Sol responde con fortaleza en Python, Go y TypeScript. La lección de ingeniería: el costo óptimo de agente de codificación no es un modelo único sino una estrategia de enrutamiento.

Fuentes

Todo lo que sostiene esta nota
  1. 01 Primary source together.ai
  2. 02 together.ai together.ai “Run GLM-5.3 first, escalate to GPT-5.6 Sol when the tests fail. That cascade solves 85.9% of DeepSWE tasks at $6.61 each. Sol alone solves 72.7% at $8.37. Thirteen points better, 21% cheaper”
  3. 03 together.ai together.ai “At $3.99 a rollout, GLM-5.3 is 2.1x cheaper than Sol ($8.37), which in value terms is 17 solves per $100 against Sol's 9”
  4. 04 together.ai together.ai “Per-task correlation is 0.43, real disagreement for two models this close on aggregate. They both solve 90 tasks; GLM-5.3 alone gets 9, Sol alone gets 7, and 7 defeat both. Their union covers 106 of 113 tasks (93.8%)”