Los pipelines RLHF y RLVR comprimen la diversidad del modelo. Cada paso de recompensa empuja las salidas hacia la respuesta correcta de mayor probabilidad, erosionando la amplitud de la distribución hasta que el modelo es confiable pero repetitivo. Funciona para benchmarks de preguntas y respuestas. Para el entrenamiento RL downstream que depende de rollouts variados para generar una señal de recompensa útil, es un costo directo. Para tareas donde la generación creativa o exploratoria importa, degrada silenciosamente el desempeño.
Un nuevo paper de Ananya Sahu, Mohit Bansal y Elias Stengel-Eskin (publicado 7 de agosto) introduce CreativeInstruct: un método de instruction-tuning de modelo único para recuperar la diversidad perdida sin renunciar a las ganancias de calidad del post-training. El mecanismo es un token de control aprendible—[StartCreativity]—inyectado durante fine-tuning supervisado. El modelo aprende que este token predice generación creativa, similar al modelo base. En tiempo de inferencia, si activarlo es una opción, no un parámetro de sampling.
Sin overhead de inferencia. Los ensembles multi-modelo y la destilación han sido el workaround para el colapso de diversidad, pero multiplican el costo de deployment y complican el serving. CreativeInstruct se ejecuta como un checkpoint único. En benchmarks de generación narrativa, iguala o supera la diversidad de baselines multi-modelo y destilados—confirmado en métricas automáticas y evaluación humana.
El paper también propone una nueva métrica de diversidad basada en graph edit distance sobre estructura narrativa. Las medidas léxicas y semánticas existentes (n-gram overlap, similitud de coseno) pierden la variación estructural: dos historias con argumentos diferentes pero vocabulario similar puntúan como menos diversas de lo que realmente son. Las métricas de graph-edit-distance operan sobre estructura del discurso y capturan la variación narrativa que esas medidas ignoran.
Anotadores humanos calificaron las salidas de CreativeInstruct como más creativas que baselines post-trained estándar en 70,3% de los casos. Esto es notable porque refleja generaciones de código abierto, no benchmarks sintéticos, y la ganancia vino sin pérdida de calidad en los puntos fuertes centrales del modelo post-trained.
El hallazgo de RL es más accionable. Cuando GRPO (group relative policy optimization, ampliamente utilizado en entrenamiento de modelos de razonamiento) fue aplicado a un checkpoint CreativeInstruct en lugar de uno post-trained estándar, el desempeño en matemáticas mejoró 4% en AMC y 5% en MATH. El mecanismo: rollouts iniciales más diversos generan una señal de recompensa más rica, permitiendo que GRPO encuentre mejores políticas antes del colapso. El punto de partida importa.
Lo difícil: esto requiere una etapa de fine-tuning supervisado en pares creativo/no-creativo etiquetados para enseñar al modelo qué predice [StartCreativity]. Los equipos que entrenan post-training desde cero pueden insertar esto; los equipos con checkpoints destilados o RLHF'd existentes deben sopesar si el trade-off calidad-diversidad justifica re-tuning. El paper no reporta experimentos a escalas muy grandes, y es incierto si las ganancias de RL del 4–5% persisten conforme la capacidad del modelo y el compute de entrenamiento crecen.
Para equipos que construyen agentes de razonamiento donde RL es parte del loop: el colapso de diversidad del post-training estándar no es una ineficiencia de fondo—es un techo en lo que GRPO o similar puede lograr. CreativeInstruct proporciona un camino documentado para elevar ese techo sin costo de inferencia.