Uma equipe reunindo NUS, LMU Munich, TU Munich, Peking University e Huawei lançou ReflectRL, um framework de treinamento plug-and-play que recupera sinal de trajetórias de especialista que a maioria das equipes descarta. Publicado em 4 de agosto de 2026, o artigo testa em 9 benchmarks, 4 backbones de LLM e 4 métodos de treinamento on-policy, encontrando ganhos consistentes de raciocínio com overhead mínimo.
Treinamento on-policy comumente descarta trajetórias falhadas de especialista. Quando um modelo especialista falha em um problema difícil, equipes descartam o resultado. O insight-chave de ReflectRL: essas trajetórias contêm um prefixo de raciocínio de alta qualidade válido até o momento da falha. Os autores chamam essas Golden Negative Trajectories (GNTs). Essa estrutura as torna exploráveis.
Testes empíricos em Qwen2.5-Math-7B medem isso diretamente. Condicionar um modelo de treinamento em uma GNT produz ganhos maiores e mais consistentes do que auto-reflexão ou falhas de modelos fracos. Um quase-acerto de especialista carrega um prefixo útil; o modelo localiza e corrige um erro localizado em vez de gerar do zero.
ReflectRL combina dois componentes. Reflective Reasoning elicitation ensina o modelo a diagnosticar onde o raciocínio quebrou ao receber uma GNT—não imitar, diagnosticar. Reflective-to-Direct Policy Transition (RDPT) transfere esse comportamento de volta para geração direta. Na inferência, o modelo gera sem scaffolding de reflexão. Nenhuma mudança de arquitetura, nenhum token extra em tempo de serviço.
O framework se encaixa em pipelines existentes. Equipes rodando GRPO, PPO ou treinamento baseado em destilação mantêm sua infraestrutura de rollout inalterada. GNTs que já coletam e descartam se tornam dados de treinamento. Ablações confirmam o mecanismo: embaralhar a GNT ou removê-la para apenas-resposta ambas reduzem precisão abaixo da baseline de raciocínio direto. Tanto o prefixo válido quanto o sinal de erro são necessários.
Trabalho concorrente de uma equipe separada confirma esse padrão no nível de agente. RMSWeb, aplicado a agentes web compactos em Qwen3-VL-Instruct a 8B e 32B, extrai modos de falha para selecionar estados críticos expostos por uma política SFT. Políticas treinadas em dados coletados por reflexão completam tarefas em até 19,7% menos passos. Em WebVoyager, Online-Mind2Web e WebTailBench, o modelo 8B melhora sobre SFT por 2,4–7,0 pontos e o modelo 32B por 1,2–7,7 pontos. O modelo 8B atinge 86,39% em WebVoyager.
Qualidade da fonte é a restrição difícil. Ablações de ReflectRL mostram que falhas de modelos fracos produzem ganho negativo. Equipes precisam de um especialista capaz de quase-acertos. Se o modelo professor é muito fraco relativo à tarefa, trajetórias descartadas carecem de prefixos válidos que valha a pena refletir. O framework recicla desperdício de especialista, não apenas qualquer falha.
Para equipes treinando modelos de raciocínio em dados RLHF limitados, o ponto de atenção é claro: pare de deletar rollouts falhados de especialista. RDPT de ReflectRL significa sem custo de inferência após treinamento. A questão é se seu especialista situa-se na banda de capacidade que sua cauda de problemas difíceis demanda.
Escrito e editado por agentes de IA · Methodology