aiexpert
Inicio / Noticias / Nota
Research · 20 ago 2026, 23:03 · 4 fuentes

Z.ai GLM-5.3 logra ganancia de codificación de 6x en base congelada, solo post-entrenamiento

Z.ai lanzó GLM-5.3 el 14 de agosto de 2026 utilizando el modelo base MoE exactamente idéntico al GLM-5.2 con ~744 mil millones de parámetros (40B activos), sin cambios, y logró una ganancia de codificación del +50% únicamente a través del escalado de post-entrenamiento. En Terminal-Bench 3.0, el modelo saltó de 4.6% a 28.3%; en DeepSWE v1.1 de 46.2% a 66.9%; en Agents' Last Exam CLI de 23.8% a 28.5%. La tesis es radical: el techo de desempeño de un modelo base congelado puede elevarse sustancialmente a través del aprendizaje por refuerzo en docenas de veces más entornos de tareas de horizonte largo sin aumentar parámetros o volver a ejecutar pre-entrenamiento.

Los entornos de post-entrenamiento cubren flujos de trabajo de ingeniería de producción, no indicaciones aisladas de codificación. Las tareas incluyen optimización de infraestructura de ML donde el modelo obtiene acceso a clusters de computo, sistemas de almacenamiento, documentación interna, bases de código y registros de experimentos—tareas que representan varios días de trabajo de un ingeniero experimentado. Z.ai sintetiza entornos de tareas de extremo a extremo utilizando agentes de investigación que observan patrones de trabajo reales y los convierten en dependencias multi-paso con estado oculto y resultados verificables.

El CEO de Z.ai Jie Tang replanteó explícitamente la fijación de la industria en el conteo de parámetros. Argumenta que el conteo de parámetros solo es sin sentido; la capacidad de razonamiento depende de la riqueza de datos de post-entrenamiento y la profundidad efectiva, mientras que la memorización prefiere conteos de parámetros más altos. El marco de escalado de 5 palancas de la empresa (parámetros base, escasez MoE, longitud de contexto, computo de post-entrenamiento, diversidad de entorno) sugiere que la obsesión con el conteo de parámetros es en sí misma el punto muerto del escalado de modelos.

Para arquitectos: este lanzamiento es un indicador. Si el post-entrenamiento en escala en una base congelada puede mover evaluaciones de codificación por un factor de seis, la frontera competitiva se desplaza del computo de pre-entrenamiento (GPU, datos) al diseño del arnés de post-entrenamiento (síntesis de entorno, verificación, señales de recompensa RL). Monitoree si los laboratorios fronterizos comienzan a enfatizar ganancias de capacidad de post-entrenamiento en lugar del escalado de pre-entrenamiento. Los pesos abiertos llegan a finales de agosto de 2026 una vez que se complete el endurecimiento de seguridad—ese es cuando la evaluación comparativa independiente confirmará o suavizará las afirmaciones del proveedor.

Fuentes

Todo lo que sostiene esta nota
  1. 01 Primary source latent.space
  2. 02 digitalapplied.com digitalapplied.com “Z.ai shipped GLM-5.3 on August 14, 2026 with a thesis most launches would bury: the base model is GLM-5.2's, untouched, and every reported gain comes from scaled post-training. Terminal-Bench 3.0 moves from 4.6 to 28.3”
  3. 03 floatboat.ai floatboat.ai “GLM-5.3 reuses the exact ~743-billion-parameter base of GLM-5.2 and gets its entire performance gain from post-training scaling — a live test of whether a base model's intelligence ceiling can be raised without a new pretraining run. Z.ai says the gains come from dozens of times more long-horizon environments”
  4. 04 latent.space latent.space “Prof Jie Tang is back on X to tell us that our shorthand for model sizes is no longer enough: 'Parameter count is only meaningful alongside three others — how much data you have, where you intend to spend your compute, and who will run the model, under what conditions.'”