Los investigadores de UC Santa Barbara y Hanbat National University publicaron CoinRAG el 7 de agosto de 2026, una optimización de caché KV para generación aumentada por recuperación que reemplaza la reutilización a nivel de fragmento con caché de "pepitas de información" sub-fragmento. En los puntos de referencia de respuesta a preguntas multi-salto de LongBench, logra una mejora F1 relativa de 5,3% — 41,7 vs. 39,6 — frente a líneas de base de RAG Estándar y Generación Aumentada por Caché, manteniendo prefill dentro de un presupuesto P99 time-to-first-token de 100 ms.

Cache-Craft (arXiv 2502.15734) cuantifica el problema en producción: prefill consume 55,4% del tiempo total de inferencia en un cluster (Sys-X) y 76% en otro (Sys-Y). El procesamiento redundante de fragmentos cuesta más de 12 mil millones de tokens por mes en LLaMA-3-70B en ocho A100 GPUs — aproximadamente $50.000 en tiempo de GPU. Los fragmentos recuperados contienen respuestas junto con contexto sustancialmente irrelevante, por lo que cachear el fragmento completo cachea el ruido junto con la señal.

CoinRAG cachea por debajo del nivel de fragmento. Sin conexión, un LLM extrae "pepitas de información" basadas en tramos de texto de cada fragmento — unidades compactas que aíslan afirmaciones relevantes. Los cachés KV para estas pepitas se precomputan y se almacenan. En inferencia, la recuperación de dos etapas reduce candidatos a nivel de fragmento, luego selecciona unidades relevantes para la consulta dentro de esos fragmentos. El sistema ensambla una representación KV contextualizada componiendo cachés de pepita precomputados con una señal de contexto a nivel de fragmento, dando al modelo coherencia entre fragmentos sin codificar fragmentos completos.

Los sistemas a nivel de fragmento enfrentan un trade-off: cumplir el SLA de 100 ms time-to-first-token con menos fragmentos o excederlo para responder preguntas multi-salto. CoinRAG desplaza esa frontera haciendo cada unidad de recuperación más pequeña y semánticamente densa. El mismo presupuesto de latencia acomoda más evidencia relevante porque cada pepita usa menos tokens — y menos prefill FLOPs — que el fragmento del que provino.

Existen enfoques competidores. CacheBlend (EuroSys '25) reutiliza cualquier caché de fragmento precomputado independientemente de la posición y recomputa selectivamente valores KV para un pequeño subconjunto de tokens para restaurar atención entre fragmentos, logrando reducción de time-to-first-token de 2,2–3,3× respecto a recompute completo. Se envía como LMCache, una integración vLLM de código abierto. CacheClip utiliza un modelo auxiliar para identificar qué tokens recomputar, logrando aceleración de prefill de 3,33× mientras mantiene 85,2–91,1% del desempenho de atención completa. CoinRAG evita recomputación al precomputar con grano más fino desde el inicio.

Existen trade-offs. La extracción de pepita requiere un pase LLM sin conexión sobre cada documento antes de servir. El fine-tuning consciente de pepita significa que el modelo objetivo ya no es estándar. Los equipos de implementación en corpus de alto cambio enfrentan presión de invalidación de caché — cada actualización de documento desencadena re-extracción y re-caching. El artículo evalúa en tres conjuntos de datos LongBench de QA multi-salto; las tareas de recuperación factual single-salto y resumen no se cubren.

CoinRAG es adecuado para cargas de trabajo donde domina QA multi-salto, el churn de documentos es bajo y una ejecución de fine-tuning es viable. CacheBlend (vía LMCache) ofrece una barrera de entrada más baja para pilas vLLM existentes con patrones de recuperación mixtos. La ganancia F1 de 5,3% bajo un presupuesto P99 estricto de 100 ms es medible, pero la dependencia de fine-tuning la convierte en un compromiso del sistema.