A eviction agressiva de KV-cache reduz custos de contexto, mas degrada modelos. Eles leem de histórico parcial, entram em loop e degeneram, queimando tokens antes de produzir respostas úteis. Pesquisadores da Universidade Nacional de Seul apresentam KV-Rescue, um framework sem treinamento que recupera precisão perdida ao parear um modelo base com eviction com um helper leve de contexto completo.

O insight central: eviction cria uma lacuna de informação, não uma lacuna de capacidade. Testando um Qwen2.5-Math 7B com eviction e um Qwen2.5-Math 1.5B de contexto completo em problemas idênticos, um oráculo selecionando a melhor resposta recuperou 79% da lacuna de precisão. Se eviction degradasse capacidade, o 1.5B seria fraco demais para ajudar. Não é, porque vê contexto completo.

Amostragem mais agressiva do modelo com eviction não fecha a lacuna. A inferência Best-of-N melhora scores mas estabiliza porque todos os candidatos vêm do mesmo cache parcial.

KV-Rescue aborda a lacuna estruturalmente. A cada passo, o base com eviction e o helper de contexto completo geram candidatos. Um modelo de recompensa de processo seleciona qual candidato estende a trajetória compartilhada. Um detector online usando sinais de entropia de token e compressibilidade elimina outputs degenerados do modelo base antes de corromperem o rastro. Sem fine-tuning necessário.

Os resultados abrangem cinco benchmarks de matemática em modelos Qwen2.5-Math 7B e 72B. Com orçamento de eviction B=64, KV-Rescue recupera 87% da precisão perdida. No MATH500 com orçamento 128, supera pass@1 full-KV em N=4 e melhora conforme N aumenta. Parar a degeneração reduz geração de token do modelo base em 43%.

Custo operacional: o helper é um modelo separado de 1.5B-parâmetros rodando ao lado da base 7B. O PRM é um terceiro modelo. O custo total escala com N e orçamento por-passo em ambos, então equipes ajustam N contra restrições de latência. O método abrange benchmarks de raciocínio matemático; desempenho de código e documentos longos não são abordados.

Para arquitetos rodando eviction agressiva de KV e vendo cliffs de precisão, isto é um fix sem treinamento: implante um modelo helper pequeno e PRM de domínio-acoplado.