Pesquisadores da UC Santa Barbara e Hanbat National University publicaram CoinRAG em 7 de agosto de 2026, uma otimização de KV cache para geração aumentada por recuperação que substitui a reutilização em nível de chunk por cache de "nuggets de informação" sub-chunk. Nos benchmarks de resposta a perguntas multi-salto LongBench, alcança melhoria relativa de F1 de 5,3% — 41,7 vs. 39,6 — contra baselines Standard RAG e Cache-Augmented Generation, mantendo prefill dentro de um orçamento P99 time-to-first-token de 100 ms.

Cache-Craft (arXiv 2502.15734) quantifica o problema em produção: prefill consome 55,4% do tempo total de inferência em um cluster (Sys-X) e 76% em outro (Sys-Y). Processamento redundante de chunk custa mais de 12 bilhões de tokens por mês em LLaMA-3-70B através de oito A100 GPUs — aproximadamente $50.000 em tempo de GPU. Chunks recuperados contêm respostas junto com contexto substancialmente irrelevante, então cachear o chunk completo cacheia o ruído junto com o sinal.

CoinRAG cacheia abaixo do nível de chunk. Offline, um LLM extrai "nuggets de informação" baseados em span de texto de cada chunk — unidades compactas isolando asserções relevantes. KV caches para esses nuggets são pré-computados e armazenados. Na inferência, recuperação em dois estágios estreita candidatos em nível de chunk, depois seleciona unidades relevantes para a consulta dentro desses chunks. O sistema monta uma representação KV contextualizada compondo caches de nugget pré-computados com um sinal de contexto em nível de chunk, dando ao modelo coerência entre chunks sem codificar chunks completos.

Sistemas em nível de chunk enfrentam uma troca: atender ao SLA de 100 ms time-to-first-token com fewer chunks ou excedê-lo para responder perguntas multi-salto. CoinRAG desloca essa fronteira tornando cada unidade de recuperação menor e semanticamente mais densa. O mesmo orçamento de latência acomoda mais evidência relevante porque cada nugget usa fewer tokens — e fewer prefill FLOPs — que o chunk do qual veio.

Abordagens concorrentes existem. CacheBlend (EuroSys '25) reutiliza qualquer cache de chunk pré-computado independente da posição e recomputa seletivamente valores KV para um pequeno subconjunto de tokens para restaurar atenção entre chunks, alcançando redução de time-to-first-token de 2,2–3,3× sobre recompute completo. É fornecido como LMCache, uma integração vLLM de código aberto. CacheClip usa um modelo auxiliar para identificar quais tokens recomputar, alcançando aceleração de prefill de 3,33× mantendo 85,2–91,1% do desempenho de atenção completa. CoinRAG evita recomputação pré-computando em grain mais fino desde o início.

Trocas existem. Extração de nugget requer uma passagem LLM offline sobre cada documento antes de servir. Fine-tuning consciente de nugget significa que o modelo alvo não é mais off-the-shelf. Equipes de implantação em corpora de alto churn enfrentam pressão de invalidação de cache — cada atualização de documento dispara re-extração e re-caching. O paper avalia em três datasets LongBench multi-hop QA; tarefas de recuperação factóide single-hop e sumarização não são cobertas.

CoinRAG convém a workloads onde multi-hop QA domina, churn de documento é baixo, e uma execução de fine-tuning é viável. CacheBlend (via LMCache) oferece barreira de entrada mais baixa para stacks vLLM existentes com padrões de recuperação mistos. O ganho F1 de 5,3% sob um orçamento P99 de 100 ms rigoroso é mensurável, mas a dependência de fine-tuning a torna um compromisso de sistema.