Z.ai lanzó GLM-5.3 el 14 de agosto de 2026 utilizando el modelo base MoE exactamente idéntico al GLM-5.2 con ~744 mil millones de parámetros (40B activos), sin cambios, y logró una ganancia de codificación del +50% únicamente a través del escalado de post-entrenamiento. En Terminal-Bench 3.0, el modelo saltó de 4.6% a 28.3%; en DeepSWE v1.1 de 46.2% a 66.9%; en Agents' Last Exam CLI de 23.8% a 28.5%. La tesis es radical: el techo de desempeño de un modelo base congelado puede elevarse sustancialmente a través del aprendizaje por refuerzo en docenas de veces más entornos de tareas de horizonte largo sin aumentar parámetros o volver a ejecutar pre-entrenamiento.
Los entornos de post-entrenamiento cubren flujos de trabajo de ingeniería de producción, no indicaciones aisladas de codificación. Las tareas incluyen optimización de infraestructura de ML donde el modelo obtiene acceso a clusters de computo, sistemas de almacenamiento, documentación interna, bases de código y registros de experimentos—tareas que representan varios días de trabajo de un ingeniero experimentado. Z.ai sintetiza entornos de tareas de extremo a extremo utilizando agentes de investigación que observan patrones de trabajo reales y los convierten en dependencias multi-paso con estado oculto y resultados verificables.
El CEO de Z.ai Jie Tang replanteó explícitamente la fijación de la industria en el conteo de parámetros. Argumenta que el conteo de parámetros solo es sin sentido; la capacidad de razonamiento depende de la riqueza de datos de post-entrenamiento y la profundidad efectiva, mientras que la memorización prefiere conteos de parámetros más altos. El marco de escalado de 5 palancas de la empresa (parámetros base, escasez MoE, longitud de contexto, computo de post-entrenamiento, diversidad de entorno) sugiere que la obsesión con el conteo de parámetros es en sí misma el punto muerto del escalado de modelos.
Para arquitectos: este lanzamiento es un indicador. Si el post-entrenamiento en escala en una base congelada puede mover evaluaciones de codificación por un factor de seis, la frontera competitiva se desplaza del computo de pre-entrenamiento (GPU, datos) al diseño del arnés de post-entrenamiento (síntesis de entorno, verificación, señales de recompensa RL). Monitoree si los laboratorios fronterizos comienzan a enfatizar ganancias de capacidad de post-entrenamiento en lugar del escalado de pre-entrenamiento. Los pesos abiertos llegan a finales de agosto de 2026 una vez que se complete el endurecimiento de seguridad—ese es cuando la evaluación comparativa independiente confirmará o suavizará las afirmaciones del proveedor.