aiexpert
Inicio / Noticias / Nota
Research · 20 ago 2026, 22:35 · 3 fuentes

Z.ai lanza GLM-5.3: mismo modelo base que GLM-5.2, pero post-entrenamiento solo eleva codificación 6×, lidera en CyberGym

Z.ai lanzó GLM-5.3 el 14 de agosto de 2026, reutilizando el mismo modelo base Mixture-of-Experts de 743 mil millones de parámetros que GLM-5.2 de junio. Toda ganancia de desempeño reportada proviene únicamente del post-entrenamiento escalado, una prueba directa de si una base congelada puede ser empujada sustancialmente más lejos a través del aprendizaje por refuerzo extendido. El modelo muestra mayores saltos en tareas de codificación y horizonte largo: Terminal-Bench 3.0 se mueve de 4.6 a 28.3 (6×), DeepSWE v1.1 de 46.2 a 66.9, y Agents' Last Exam de 23.8 a 28.5, todos reportados por el proveedor con documentación completa del arnés.

El resultado sorprendente es la ciberseguridad: GLM-5.3 alcanza 84.5% en CyberGym, un benchmark de descubrimiento de vulnerabilidad, superando a Claude Fable 5 (83.8%) y GPT-5.6 Sol (83.6%). Z.ai entrenó intencionalmente en datos de vulnerabilidad para mejorar el descubrimiento de errores, pero el modelo aparentemente desarrolló razonamiento de cadena de ataque multietapa a escala—comportamiento que la empresa enmarca como emergente en lugar de dirigido. En costo por tarea, GLM-5.3 anota 31.4% en el Code Bench interno de Z.ai en ~50K tokens de salida, versus 29.5% de Opus 4.8 en ~120K tokens, señalando ganancias significativas de eficiencia de inferencia junto con saltos de capacidad.

Para investigadores y equipos que construyen sistemas agenticos de horizonte largo, la trayectoria GLM-5.3 señala que el escalamiento post-entrenamiento y la diversidad ambiental pueden mover bases fijas más lejos de lo que los arquitectos esperaban, particularmente en tareas que recompensan el razonamiento sostenido y el refinamiento iterativo. Los pesos abiertos se prometen ~28 de agosto de 2026 (dos semanas después del lanzamiento) después de la evaluación de seguridad, significando que la verificación independiente a través de Terminal-Bench y la reproducibilidad pública aún están pendientes. La observación de que el recuento de parámetros cuenta solo una parte de la historia de escalamiento—combinándola con computación post-entrenamiento, volumen de datos y horizonte de tarea—desafía la fijación de la industria en el tamaño del modelo como la señal de capacidad primaria.

Fuentes

Todo lo que sostiene esta nota
  1. 01 Primary source latent.space
  2. 02 [AINews] Death of Params: Z.ai CEO Jie Tang on GLM 5.3 and the new Post-training Scaling Law latent.space “GLM-5.3's big jumps come solely from RL on long horizon environments: The environments now cover a much broader range of production workflows, with tasks designed around how engineering and research work is actually carried out in practice.”
  3. 03 GLM-5.3: Post-Training Alone Rebuilt the Coding Ladder digitalapplied.com “Terminal-Bench 3.0 moves from 4.6 to 28.3 against GLM-5.2. DeepSWE v1.1 moves from 46.2 to 66.9. Agents' Last Exam (CLI) moves from 23.8 to 28.5. On CyberGym GLM-5.3 scores 84.5%, ahead of Claude Fable 5 (83.8%) and GPT-5.6 Sol (83.6%).”