Knowledge Pull Requests descomponen actualizaciones de documentos en propuestas de afirmaciones interpretables y diffs de texto, separando qué conocimiento cambia de cómo cambia el texto. Investigadores de Johns Hopkins evaluaron el enfoque en revisiones de Wikipedia en múltiples idiomas y actualizaciones de reportes impulsadas por consultas, encontrando que los KPRs integran más información por token generado que reescrituras desde fuentes o regeneración desde cero, mientras que fundamentan respuestas a preguntas mejor que modelos frontera con búsqueda.
El método opera en tres etapas. Primero, un LLM descompone fuentes en afirmaciones atómicas y descontextualizadas—el mismo proceso aplicado sin conexión para cachear las afirmaciones del documento principal. Segundo, el sistema clasifica cada afirmación de fuente como cubierta (ya en el principal), conflictiva (contradice contenido existente), o ausente (nueva). Las afirmaciones ausentes se filtran por relevancia y se enrutan a secciones del documento; las afirmaciones conflictivas se marcan para revisión humana en lugar de resolverse silenciosamente. Tercero, cada sección afectada se reescribe para integrar las afirmaciones aprobadas, y se genera un diff contra el original. El resultado es un ChangeLog: una propuesta de afirmación que muestra qué conocimiento se está añadiendo y dónde, más un diff de documento que muestra los cambios textuales.
En Wikipedia, los KPRs revisaron artículos en inglés usando conocimiento de ediciones en otros idiomas. El artículo reporta precisión de información (InfoP) de 0.878 para KPRs versus 0.837 para reescritura desde texto bruto y 0.853 para condicionamiento en afirmaciones sin filtrar. La recuperación de información para contenido añadido (InfoR-A) alcanzó 0.891 para KPRs contra 0.716 para reescritura de texto bruto. En respuesta a preguntas fundamentadas en los artículos revisados, los KPRs lograron 69.2% de precisión en preguntas multilingües en siete modelos, comparado a 48.4% para reescritura de texto bruto y 58.5% para afirmaciones sin filtrar. En las 100 preguntas multilingües más difíciles que ningún modelo denso respondió en libro cerrado, un modelo de 7B fundamentado en un artículo revisado por KPR superó a GPT Sol 5.6 con búsqueda web, que recuperó solo 38% de precisión.
El costo de edición favoreció a los KPRs: requirieron 11.2 bloques de edición contiguos para que un revisor aprobara, versus 25.3 para afirmaciones sin filtrar, mientras preservaban 97.3% del artículo original. En reportes impulsados por consultas de RAGTIME actualizados en dos rondas, los KPRs mantuvieron mayor precisión y recuperación que líneas base. En la configuración de conflicto, donde fuentes de ronda 2 contradijeron contenido de ronda 1, los KPRs lograron 0.811 de precisión de información y 0.782 de recuperación de información para contenido retenido, comparado a 0.666 y 0.625 para reescritura de texto bruto. El sistema retuvo afirmaciones conflictivas en lugar de resolverlas implícitamente, manteniendo precisión donde métodos condicionados en texto fueron engañados.
La implementación usa Qwen 3.5-27B para todos los pasos de LLM—descomposición de afirmaciones, clasificación, enrutamiento y reescritura. El artículo reconoce que cada paso intermedio requiere una llamada a LLM, haciendo la tubería computacionalmente cara; alternativas más baratas como codificadores ligeros para clasificación de contención o enrutamiento podrían reducir costo por paso. La revisión humana no fue evaluada: los experimentos retuvieron conflictos marcados de la reescritura en lugar de tener humanos adjudicarlos, dejando abierta la pregunta de si un ChangeLog realmente hace editores más rápidos y precisos que un diff de texto.
Para equipos que mantienen documentos que evolucionan—artículos de Wikipedia, especificaciones técnicas, reportes de inteligencia, síntesis impulsadas por consultas—los KPRs ofrecen un patrón desplegable: operar sobre afirmaciones en lugar de texto bruto, exponer conflictos en lugar de resolverlos silenciosamente, y concentrar cambios en bloques revisables para que un humano pueda evaluar qué conocimiento está realmente cambiando antes de aprobar la reescritura.