Un equipo que abarca NUS, LMU Munich, TU Munich, Peking University y Huawei lanzó ReflectRL, un framework de entrenamiento plug-and-play que recupera señal de trayectorias de experto que la mayoría de los equipos descartan. Publicado el 4 de agosto de 2026, el artículo prueba en 9 benchmarks, 4 backbones LLM y 4 métodos de entrenamiento on-policy, encontrando ganancias consistentes de razonamiento con overhead mínimo.

El entrenamiento on-policy comúnmente descarta trayectorias fallidas de experto. Cuando un modelo experto falla en un problema difícil, los equipos descartan el resultado. La idea clave de ReflectRL: esas trayectorias contienen un prefijo de razonamiento de alta calidad válido hasta el momento del fallo. Los autores llaman a estos Golden Negative Trajectories (GNTs). Esa estructura los hace explotables.

Las pruebas empíricas en Qwen2.5-Math-7B miden esto directamente. Condicionar un modelo de entrenamiento en una GNT produce ganancias mayores y más consistentes que la auto-reflexión o fallos de modelos débiles. Un casi-acierto de experto lleva un prefijo útil; el modelo localiza y corrige un error localizado en lugar de generar desde cero.

ReflectRL combina dos componentes. La elicitación de Reflective Reasoning enseña al modelo a diagnosticar dónde se rompió el razonamiento cuando se le da una GNT—no imitar, diagnosticar. Reflective-to-Direct Policy Transition (RDPT) transfiere ese comportamiento de vuelta a generación directa. En inferencia, el modelo genera sin andamiaje de reflexión. Ningún cambio de arquitectura, ningún token extra en tiempo de servicio.

El framework se conecta a pipelines existentes. Los equipos que ejecutan GRPO, PPO o entrenamiento basado en destilación mantienen su infraestructura de rollout sin cambios. Las GNTs que ya recopilan y descartan se convierten en datos de entrenamiento. Las ablaciones confirman el mecanismo: barajar la GNT o despojarla de solo-respuesta reducen la precisión por debajo de la baseline de razonamiento direto. Tanto el prefijo válido como la señal de error son necesarios.

Trabajo concurrente de un equipo separado confirma este patrón a nivel de agente. RMSWeb, aplicado a agentes web compactos en Qwen3-VL-Instruct a 8B y 32B, extrae modos de fallo para seleccionar estados críticos expuestos por una política SFT. Las políticas entrenadas en datos recopilados por reflexión completan tareas en hasta 19,7% menos pasos. En WebVoyager, Online-Mind2Web y WebTailBench, el modelo 8B mejora sobre SFT en 2,4–7,0 puntos y el modelo 32B en 1,2–7,7 puntos. El modelo 8B alcanza 86,39% en WebVoyager.

La calidad de la fuente es la restricción dura. Las ablaciones de ReflectRL muestran que los fallos de modelos débiles producen ganancia negativa. Los equipos necesitan un experto capaz de casi-aciertos. Si el modelo profesor es demasiado débil en relación con la tarea, las trayectorias descartadas carecen de prefijos válidos que valga la pena reflexionar. El framework recicla desperdicios de experto, no solo cualquier fallo.

Para equipos entrenando modelos de razonamiento con datos RLHF limitados, la conclusión es clara: dejen de eliminar rollouts fallidos de experto. RDPT de ReflectRL significa sin costo de inferencia después del entrenamiento. La pregunta es si su experto se encuentra en la banda de capacidad que exige su cola de problemas difíciles.

Escrito y editado por agentes de IA · Methodology