Knowledge Pull Requests decompõem atualizações de documentos em propostas de claims interpretáveis e diffs de texto, separando o que muda no conhecimento de como o texto muda. Pesquisadores da Johns Hopkins avaliaram a abordagem em revisões da Wikipedia em múltiplos idiomas e atualizações de relatórios orientados por consultas, descobrindo que KPRs integram mais informação por token gerado do que reescrever de fontes ou regenerar do zero, enquanto fundamentam question answering melhor do que modelos de fronteira com busca.
O método opera em três estágios. Primeiro, um LLM decompõe fontes em claims atômicos e descontextualizados—o mesmo processo aplicado offline para cachear os claims do documento principal. Segundo, o sistema classifica cada claim da fonte como coberto (já no principal), conflitante (contradizendo conteúdo existente) ou ausente (novo). Claims ausentes são filtrados por relevância e roteados para seções do documento; claims conflitantes são sinalizados para revisão humana em vez de serem resolvidos silenciosamente. Terceiro, cada seção afetada é reescrita para integrar os claims aprovados, e um diff é gerado contra o original. O resultado é um ChangeLog: uma proposta de claim mostrando qual conhecimento está sendo adicionado e onde, mais um diff de documento mostrando as mudanças textuais.
Na Wikipedia, KPRs revisaram artigos em inglês usando conhecimento de edições em outros idiomas. O paper relata precisão de informação (InfoP) de 0.878 para KPRs versus 0.837 para reescrever de texto bruto e 0.853 para condicionamento em claims não filtrados. Recall de informação para conteúdo adicionado (InfoR-A) alcançou 0.891 para KPRs contra 0.716 para reescrever de texto bruto. Em question answering fundamentado nos artigos revisados, KPRs alcançaram 69.2% de acurácia em questões multilíngues em sete modelos, comparado a 48.4% para reescrever de texto bruto e 58.5% para claims não filtrados. Nas 100 questões multilíngues mais difíceis que nenhum modelo denso respondeu closed-book, um modelo 7B fundamentado em um artigo revisado por KPR superou GPT-4o 5.6 com busca web, que recuperou apenas 38% de acurácia.
O custo de edição favoreceu KPRs: elas exigiram 11.2 blocos de edição contíguos para um revisor aprovar, versus 25.3 para claims não filtrados, enquanto preservavam 97.3% do artigo original. Em relatórios RAGTIME orientados por consultas atualizados em duas rodadas, KPRs mantiveram precisão e recall maiores que baselines. Na configuração de conflito, onde fontes da rodada 2 contradiziam conteúdo da rodada 1, KPRs alcançaram 0.811 de precisão de informação e 0.782 de recall de informação para conteúdo retido, comparado a 0.666 e 0.625 para reescrever de texto bruto. O sistema reteve claims conflitantes em vez de resolvê-los implicitamente, mantendo precisão onde métodos condicionados em texto foram enganados.
A implementação usa Qwen 3.5-27B para todos os passos de LLM—decomposição de claims, classificação, roteamento e reescrita. O paper reconhece que cada passo intermediário requer uma chamada de LLM, tornando o pipeline computacionalmente caro; alternativas mais baratas como encoders leves para classificação de contenção ou roteamento poderiam reduzir o custo por passo. Revisão humana não foi avaliada: os experimentos retiveram conflitos sinalizados da reescrita em vez de ter humanos arbitrarem, deixando em aberto a questão de se um ChangeLog realmente torna editores mais rápidos e precisos do que um diff de texto.
Para equipes mantendo documentos que evoluem—artigos da Wikipedia, especificações técnicas, relatórios de inteligência, sínteses orientadas por consultas—KPRs oferecem um padrão implementável: operar sobre claims em vez de texto bruto, expor conflitos em vez de resolvê-los silenciosamente, e concentrar mudanças em blocos revisáveis para que um humano possa avaliar qual conhecimento está realmente mudando antes de aprovar a reescrita.