Together AI ejecutó 904 rollouts—452 por modelo, cuatro pruebas en cada una de las 113 tarefas DeepSWE—comparando GLM-5.3 y GPT-5.6 Sol en un benchmark de codificación diseñado para poner a prueba la ingeniería de software real en múltiples lenguajes y dominios. Una cascada de dos etapas que ejecuta GLM-5.3 primero y escala a Sol en caso de falla de prueba resuelve el 85,9% de las tareas a $6,61 por rollout. Sol por sí solo resuelve el 72,7% a $8,37. La cascada supera a Sol de modelo único por 13,2 puntos porcentuales y cuesta 21% menos.

En pass@1, Sol lidera 72,7% contra 69,0% de GLM-5.3—una brecha de 3,7 puntos dentro del ruido estadístico. Pass@2 invierte el orden: GLM-5.3 alcanza 81,1%, Sol 81,0%. En pass@4, GLM-5.3 se adelanta a 87,6% versus 85,8%. La brecha de costo es más pronunciada. GLM-5.3 se ejecuta a $3,99 por rollout, Sol $8,37—una diferencia de 2,1x. Por cada $100 gastados, GLM-5.3 resuelve 17 tareas; Sol resuelve 9.

La latencia corta por el otro lado. Sol completa un rollout en 19 minutos en 61 pasos con 60k tokens de salida. GLM-5.3 tarda 35 minutos, 124 pasos y 80k tokens. Para flujos de trabajo síncronos y de intervención humana, la brecha de latencia justifica el costo de Sol. Para pipelines en lote y agentes offline, el tiempo extra es irrelevante y el costo domina.

Los modos de fallo muestran dónde la decisión de enrutamiento se vuelve operacional. Sol rompe la suite de pruebas existente del repositorio en el 20% de los fallos—la firma de regresión en toda la familia GPT. GLM-5.3 lo rompe en el 11%. Cuando GLM-5.3 falla, se queda corto: una tasa de casi-acierto de 61% versus 54% de Sol. Cualquier pipeline que acepte diffs de Sol necesita un gate de regresión completo. GLM-5.3 lo necesita menos.

Los modelos se dividen claramente por dominio y lenguaje. Sol gana en modelado de datos y serialización (92%), herramientas de build y ops (73%), concurrencia (72%) y conformidad de protocolo (59%). GLM-5.3 gana en lenguajes de query y config (88%), internals de lenguaje (83%), reactividad con estado (73%) y JavaScript (90% versus 75%) y Rust (70% versus 60%). Sol se lleva Python (74% a 66%), Go (79% a 76%) y TypeScript (66% a 61%). El punto débil claro de GLM-5.3 es la conformidad de protocolo en 44%, 15 puntos por debajo de Sol.

La cascada funciona porque los modelos discrepan sustancialmente. La correlación por tarea es 0,43. Ambos resuelven 90 tareas. GLM-5.3 resuelve exclusivamente 9 que Sol nunca alcanza; Sol resuelve exclusivamente 7 que GLM-5.3 falla; 7 derrotan a ambos. Su unión cubre 106 de 113 tareas (93,8%). La baja correlación significa que la escalada enruta a Sol solo donde GLM-5.3 genuinamente falla, sin duplicar trabajo.

El árbol de decisión del arquitecto es directo. Usar GLM-5.3 por defecto para cargas de trabajo en lote y repositorios con mucho JavaScript/Rust. Enrutar a Sol cuando la latencia es visible para el usuario, cuando la tarea es conformidad de protocolo o infraestructura de sistemas, o cuando se trabaja en Python, Go o TypeScript a escala. Ejecutar la cascada si su carga de trabajo abarca dominios sin suposición previa en tareas difíciles. Poner una suite de regresión alrededor de los diffs de Sol de todas formas; omitirla para GLM-5.3 y mayormente estarán en lo correcto.

La capa de peso abierto se ha acercado a 3,7 puntos pass@1 del líder de la frontera en un benchmark de codificación difícil, a un costo 2,1x menor, con mejor precisión por dólar en configuraciones de múltiples intentos. La pregunta de modelo único es menos interesante que hace seis meses. La pregunta de enrutamiento es donde viven las ganancias de eficiencia ahora.