aiexpert
Inicio / Noticias / Nota
Research · 22 ago 2026, 06:36 · 4 fuentes

GLM-5.3 vs Claude Fable 5 en DeepSWE: 69% de precisión a 5,4x menos costo; estrategia de enrutamiento gana

En el benchmark de codificación DeepSWE v1.1, Claude Fable 5 anota 69,7% pass@1 a $21,63 por tarea, mientras que GLM-5.3 anota 69,0% a $3,99 por tarea—una diferencia de costo de 5,4x. Por $100 gastado, GLM-5.3 resuelve 17 tareas mientras Fable resuelve 3, haciendo que GLM sea el camino más eficiente en costos para codificación agéntica restringida por presupuesto. DeepSWE prueba ingeniería de software de largo horizonte en 113 tareas originales en 5 idiomas, construyendo benchmarks libres de contaminación que reflejan cómo los agentes de codificación de frontera realmente funcionan en trabajo real de ingeniería de software.

Los modelos se separan una vez que se permiten reintentos: GLM-5.3 lidera pass@2 con 81,1% versus 77,1% de Fable 5, y extiende esa ventaja en pass@4 (87,6% vs. 84,1%). Este patrón favorece equipos que usan estrategias de enrutamiento o cascada: ejecute GLM-5.3 primero a bajo costo, escale a la precisión de primer intento superior de Fable 5 solo cuando GLM falla. La correlación por tarea entre los dos es 0,65, el acuerdo más alto en el conjunto de comparación, por lo que resuelven básicamente los mismos problemas a través de caminos diferentes.

Para despliegues en producción, el equilibrio es claro: GLM-5.3 es la jugada de optimización de costos, entregando 69% de precisión a una fracción del precio de Fable; Fable 5 es el techo de calidad, con desempeño de primer intento ligeramente superior y razonamiento más fuerte en trabajo de sistemas complejos. A escala de 10.000 tareas, la brecha de costo ($39.900 vs. $216.300) justifica lógica de enrutamiento mixto. Ningún modelo es universalmente superior—la elección depende de si su carga de trabajo puede absorber reintentos o exige precisión de primer intento.

Fuentes

Todo lo que sostiene esta nota
  1. 01 Primary source together.ai
  2. 02 together.ai together.ai “GLM-5.3 and Claude Fable 5 finish within noise of each other on DeepSWE accuracy. Fable 5 posts 69.7% pass@1 and GLM-5.3 posts 69.0%, a 0.7 point gap”
  3. 03 together.ai together.ai “GLM-5.3 costs $3.99 per rollout vs $21.63 for Fable 5. Per $100 spent, GLM-5.3 solves 17 tasks and Fable solves 3”
  4. 04 together.ai together.ai “Claude Fable 5 leads pass@1 by 0.7 points at 69.7%, but GLM-5.3 dominates retries. It leads pass@2 (81.1% vs. 77.1%) and pass@4 (87.6% vs. 84.1%)”