La capacidad de Muon de acelerar grokking en el entrenamiento de transformers tiene un lado oscuro: un nuevo estudio empírico publicado el 7 de agosto de 2026 por IBM Research muestra que los modelos entrenados bajo la división híbrida estándar Muon/AdamW agarran aritmética modular rápidamente y luego colapsan. Las nueve configuraciones de optimizador probadas en (a+b) mod 113 agarraron, luego perdieron generalización. Entre cinco semillas, la referencia AdamW seleccionada se recuperó pero aún cayó por debajo del umbral de precisión en cuatro de ellas, alcanzando 27,59%.
El fallo no es un caso extremo. Los autores Ali Janati, Kaoutar El Maghraoui, Andrei Kanavalau y Anass Belfatmi probaron la misma configuración en dos módulos, dos anchos de modelo, dos fracciones de datos de entrenamiento, resta modular y múltiples profundidades. Cada variante colapsó. La causa raíz es estructural: la capa de representación y la lectura de salida están conjuntamente restringidas solo hasta un mapa lineal invertible que la pérdida de entropía cruzada nunca resuelve. No hay una solución única que el gradiente intente encontrar, por lo que ningún grupo de parámetros está anclado a nada fijo.
La divergencia se vuelve aguda una vez que el modelo resuelve el conjunto de entrenamiento. La norma del gradiente cae al orden 10^−6, efectivamente cerca de cero. Los dos grupos de optimizador responden de manera opuesta: la elasticidad del tamaño de paso de Muon es −0,03 mientras que la de AdamW es +1,5. Muon mueve su grupo de parámetros 8,0 veces más rápido por parámetro. Muon continúa remodelando matrices de peso oculto mientras que los embeddings administrados por AdamW y la cabeza de salida se desplazan a una fracción de esa tasa. La interfaz de representación-salida, ya ambigua por construcción, ahora está siendo separada por velocidades de actualización desiguales.
La evidencia más clara del artículo proviene de un experimento de congelamiento. Comenzando desde puntos de control idénticos a nivel de bit, los investigadores congelaron un grupo de parámetros sobre 451.400 pasos posteriores a grokking en cinco semillas emparejadas. Congelar el grupo de embedding y lectura—el lado AdamW—eliminó completamente el colapso: cero evaluaciones por debajo del umbral en ejecuciones congeladas, en comparación con 137–321 en brazos descongelados. Un botón apaga el fallo.
Eliminar la ortogonalización y normalización de Muon no resuelve el problema. Sin esas operaciones, la representación interna de Fourier colapsa de 326 pares conjugados efectivos a 4. Esa variante no muestra colapso recurrente pero falla terminalmente en su lugar—una catástrofe diferente. Las propiedades de preservación de geometría de Muon son necesarias para que exista la representación rica. También hacen que la falta de coincidencia de velocidad posterior a grokking sea tan dañina.
El análisis de circuito de Fourier en 43 puntos de control y cinco semillas aclara la mecánica. En operación normal, la familia de Fourier alineada con la tarea alcanza una precisión del 100% por sí sola. En el régimen de colapso, emergen dos modos de fallo: fallo de circuito, donde la familia de Fourier alineada con la tarea deja de resolver la tarea completamente, y enmascaramiento, donde permanece perfecta pero es superada por un resto adversarial casi igual—el modelo completo alcanza 45,85%. Reescalar el circuito alineado con la tarea restaura 99,9%. Un detalle crítico: a través de un colapso abrupto, el soporte de Fourier estándar y el coseno de distribución de potencia (0,9899) permanecen estables. El diagnóstico estándar no señala fallo antes de que ocurra.
Esto importa para cualquiera que ejecute Muon en producción. La división estándar—Muon en matrices de peso oculto, AdamW en embeddings y cabeza de salida—se implementa en Moonlight y se reporta que se usa en las ejecuciones de entrenamiento >1T-parámetros de Kimi. Un artículo anterior (Wang, 2026) mostró que reducir el conteo de iteración de Newton-Schulz de cinco a uno hace que la solución grokked sea frágil a tasas de aprendizaje más altas. El nuevo trabajo muestra que la inestabilidad es posible incluso con la configuración canónica de cinco iteraciones, impulsada puramente por asimetría de velocidad posterior a grokking.
La corrección quirúrgica que demuestra el artículo es congelar el grupo de embedding/lectura una vez que el modelo resuelve el conjunto de entrenamiento. Si eso se generaliza más allá de la aritmética modular al preentrenamiento a gran escala sigue siendo una pregunta abierta. Lo que ya no está abierto: el monitoreo del espectro de Fourier no atrapará este colapso, y la suposición estándar de que grokking implica una solución generalizada estable es incorrecta.