RESEARCHPOR AI|EXPERT SCOUT· sábado, 1 de agosto de 2026· 4 MIN DE LECTURA
Equipo de Maryland ajusta la constante oculta de OPSD para corregir la fragilidad
Los investigadores resuelven la fragilidad de OPSD replanteando la autodestilación como una familia de parámetros controlada por β (peso de penalidad KL). Insight de ingeniería: la mayoría de las implementaciones están atrapadas en β=1; variar β recupera estabilidad y desempeño.
FIG. 01
Un artículo de la Universidad de Maryland publicado el 30 de julio resuelve un problema central en el post-entrenamiento de LLMs: la autodestilación en política (OPSD) mejora el razonamiento de manera consistente pero falla de forma impredecible en producción. La causa es una única constante codificada en el método. OPSD vanilla establece β=1 como el peso de penalidad KL. β-OPSD expone ese parámetro como ajustable.
OPSD requiere solo un modelo. El estudiante ve el problema; el profesor recibe la solución de verdad fundamental como contexto privilegiado. Ambos comparten pesos, eliminando el segundo modelo y el checkpoint de profesor separado que requiere la destilación estándar en política. La memoria de GPU se reduce un 40–60%. OPSD muestrea una trayectoria por problema versus ocho de GRPO, preservando la ventaja de eficiencia de tokens sobre métodos de RL pesados en rollout.
La divergencia a nivel de token en OPSD es altamente sesgada: los tokens estilísticos ("wait", "think", "therefore") acumulan divergencia mucho mayor que los tokens matemáticamente significativos y sofocan la señal de aprendizaje. Los rollouts largos sufren colapso de entropía y repetición. Múltiples grupos de investigación han registrado de forma independiente estos modos de fallo.
OPSD vanilla es equivalente a resolver un objetivo de RL penalizado por KL con β fijo en exactamente 1. Esa equivalencia era invisible porque β nunca fue expuesto como parámetro. β-OPSD reescribe el objetivo explícitamente. La política óptima bajo cualquier β es una interpolación geométrica entre la política de referencia (conservadurismo total, β → ∞) y el profesor privilegiado (confianza total, β → 0). El artículo deriva una solución de forma cerrada y la convierte en un objetivo de destilación. Para cada β, mezcle logits de política de referencia y profesor a nivel de token—un único pase directo que aproxima RL basado en rollout. La asignación de crédito de retorno-a-ir alinea actualizaciones por token con recompensa a nivel de secuencia.
Los equipos que ejecutan Qwen3-4B o modelos similares para razonamiento matemático ahora pueden apartarse de β=1. β-OPSD supera consistentemente OPSD vanilla en benchmarks de razonamiento matemático con ganancias en estabilidad de optimización y tasas de éxito downstream. La evaluación se centra en matemáticas de nivel competitivo, donde la fragilidad es más evidente.
OPSD ha sido adoptado en Qwen3, MiMo-V2-Flash y GLM-5. β-OPSD fue publicado el 30 de julio de 2026. Su implementación de logit-mixing es compatible como reemplazo directo con pipelines OPSD existentes: sin nueva arquitectura, sin segundo pase de inferencia, sin modelo externo. Los equipos que ejecutan OPSD vanilla tienen una ruta de actualización de bajo roce.
La pregunta abierta es la sensibilidad. El artículo muestra que valores de β distintos de 1 mejoran los resultados, pero los equipos de producción necesitan búsquedas para entender la estabilidad óptima en tarefas y tamaños de modelo. Un β que ayuda en matemáticas estilo AIME puede funcionar diferentemente en razonamiento agentico o de código.