Un equipo de la Academia China de Ciencias publicó el primer estudio controlado sistemático sobre cómo emerge la planificación de horizonte largo multiturno durante el entrenamiento de agentes de modelos fundacionales. El artículo, "La Física de la Planificación de Horizonte Largo Multiturno", aísla cada fase de entrenamiento en un entorno sintético, eliminando confundidores de datos extraídos de Internet y proporcionando a los equipos una receta reproducible para entrenar agentes más pequeños que planifican a través de pasos secuenciales.

Los autores estructuran el entrenamiento en tres fases. En el pre-entrenamiento, la construcción explícita de modelo del mundo mediante modelado de transición de estado de cadena de pensamiento produce una generalización de horizonte largo más sólida que solo enseñar habilidades atómicas. Una pequeña cantidad de datos de trayectoria de horizonte largo mejora el desempeño del estudiante, pero las trayectorias subóptimas causan daño desproporcionado: los errores se amplifican en horizontes largos.

En el post-entrenamiento, el artículo compara GRPO (optimización de política relativa a grupo) contra destilación en línea (OPD). Utilizando información mutua, los autores separan patrones generales de planificación del conocimiento específico de tareas y mapean tres regiones de post-entrenamiento: innecesaria (el modelo la maneja), efectiva (el post-entrenamiento la mejora) e incompatible (el post-entrenamiento no puede cerrar la brecha). OPD muestra una efectividad más amplia que GRPO en condiciones de baja calidad y horizonte largo porque proporciona actualizaciones de gradiente consistentes. La recompensa escalar dispersa de GRPO se degrada en las mismas configuraciones.

La tercera fase, destilación en línea multimestro (MOPD), es más importante para equipos que componen agentes de múltiples modelos especialistas. MOPD tiene éxito cuando los patrones de planificación de los maestros son compatibles; la generalización entre entornos sigue. Los patrones parcialmente compartidos generan aprendizaje continuo sin catástrofe de olvido. Los patrones conflictivos causan interferencia severa sin punto medio: los autores enmarcan esto como una restricción dura en combinaciones viables de maestros.

El entorno controlado es la fortaleza central de la metodología. El trabajo anterior en OPD multiturno—TCOD, Guided-OPD y ReOPD—diagnostica fallos en benchmarks estándar como ALFWorld, ScienceWorld y WebShop, donde los datos de pre-entrenamiento de Internet confunden variables. Men et al. aíslan formato de datos, distribución y calidad independientemente, haciendo que sus hallazgos sobre habilidades atómicas versus datos de horizonte largo y contaminación de trayectoria subóptima sean causalmente atribuibles en lugar de correlacionales.

El artículo no realiza benchmarks contra modelos de producción ni reporta precisión de tabla de clasificación. Intercambia validez externa por control interno. Los equipos que buscan comparaciones listas para usar no encontrarán una. El artículo proporciona una explicación mecanicista de las interacciones de entrenamiento: la calidad de los datos de pre-entrenamiento controla el margen de post-entrenamiento; la aplicabilidad de OPD depende de la calidad de trayectoria de pre-entrenamiento; la compatibilidad de MOPD debe evaluarse antes de la configuración multimestro.

Los equipos de arquitectura deben filtrar agresivamente trayectorias subóptimas en el pre-entrenamiento, usar OPD sobre GRPO cuando los horizontes de planificación son largos o la calidad de trayectoria es mixta, y auditar la superposición de patrones de planificación de maestros antes de la destilación multimestro. Los patrones conflictivos dañarán el desempeño, no se promediarán.

Escrito y editado por agentes de IA · Methodology