Pesquisadores da University of the Witwatersrand publicaram Redistribution-based Cost Inference (RCI), um framework que possibilita aprendizado por reforço offline seguro sem anotações de custo por passo. O artigo, lançado em 12 de agosto de 2026, resolve um gargalo crítico: métodos padrão de RL seguro requerem rótulos de custo densos c(s, a) em cada timestep, mas datasets de produção—logs de autonomia em rodovias, rastreamentos de decisões clínicas, históricos de trading—raramente os contêm. Em vez disso, monitores de segurança emitem um único sinal binário na primeira transição insegura. RCI converte esse feedback esparso no nível de trajetória em estimativas densas de custo por passo antes de alimentar o dataset aumentado para qualquer solver de RL offline restringido padrão.
RCI trata a lacuna como um problema de atribuição de crédito temporal. Um módulo de decomposição de retorno—instanciado com RUDDER, embora GRD seja um substituto direto—redistribui o sinal de parada terminal para trás através da trajetória, produzindo uma sequência de custo equivalente ao retorno do rótulo esparso original. A garantia-chave: a redistribuição equivalente ao retorno preserva tanto o conjunto de políticas viáveis quanto o Lagrangiano ótimo no Processo de Decisão de Markov Restringido. Após redistribuição, qualquer algoritmo de RL offline restringido treina no dataset enriquecido; o artigo usa BCQ-Lagrangian como padrão, com CPQ e CDT como substitutos diretos.
Os experimentos abrangeram direção em rodovias e manipulação robótica em três regimes de dataset: trajetórias de política insegura, trajetórias de política aleatória e políticas de comportamento misto. RCI produziu taxas de violação de restrição substancialmente menores do que dois baselines—treinamento com custo esparso e inferência de custo baseada em classificador—mantendo recompensa de tarefa comparável a um baseline offline irrestrito. Os autores relatam robustez a ruído de rótulo e composições heterogêneas de dataset, os modos de falha mais prováveis ao montar corpora offline de múltiplas fontes. O artigo não publica um número único de violação de resumo; equipes devem reproduzir experimentos específicos do domínio antes da implantação.
A modularidade do RCI é seu ponto forte. O framework desacopla anotação do aprendizado de política, permitindo que equipes troquem o backend de redistribuição (RUDDER vs. GRD) e solver downstream (BCQ-Lagrangian, CPQ, CDT) independentemente. A infraestrutura de RL offline existente não precisa de substituição—apenas um estágio de pré-processamento insere RCI antes da ingestão de dataset. Para equipes executando conservative Q-learning ou decision transformers restringidos, a adoção é uma adição de pipeline.
RCI aborda por que o RL seguro permanece fora dos loops de controle de produção em robótica, veículos autônomos e suporte de decisão clínica: o custo de anotação de cada transição. Sistemas de trading e pipelines de recomendação médica compartilham a mesma restrição—revisores humanos sinalizam episódios, não passos. A garantia do RCI de que redistribuição é sem perda sob otimização Lagrangiana CMDP oferece uma alternativa com princípios à modelagem de custo heurística.
O código está disponível. A restrição-chave: as garantias do RCI assumem redistribuição equivalente ao retorno; a qualidade de decomposição depende do modelo RUDDER ou GRD se ajustando à estrutura causal real de violações. Datasets barulhentos ou enganosamente simples podem degradar a fidelidade de redistribuição. Execute ablações na composição de dataset antes de implantar em loops críticos de segurança.