La eviction agresiva de KV-cache reduce costos de contexto, pero degrada modelos. Leen del historial parcial, entran en bucle y degeneran, quemando tokens antes de producir respuestas útiles. Investigadores de la Universidad Nacional de Seúl presentan KV-Rescue, un marco sin entrenamiento que recupera precisión perdida al emparejar un modelo base con eviction con un asistente ligero de contexto completo.
El insight central: la eviction crea una brecha de información, no una brecha de capacidad. Probando un Qwen2.5-Math 7B con eviction y un Qwen2.5-Math 1.5B de contexto completo en problemas idénticos, un oráculo seleccionando la mejor respuesta recuperó el 79% de la brecha de precisión. Si la eviction degradara capacidad, el 1.5B sería demasiado débil para ayudar. No es así, porque ve contexto completo.
El muestreo más agresivo del modelo con eviction no cierra la brecha. La inferencia Best-of-N mejora puntuaciones pero se estabiliza porque todos los candidatos provienen del mismo caché parcial.
KV-Rescue aborda la brecha estructuralmente. En cada paso, el modelo base con eviction y el asistente de contexto completo generan candidatos. Un modelo de recompensa de proceso selecciona qué candidato extiende la trayectoria compartida. Un detector online usando señales de entropía de token y compresibilidad elimina salidas degeneradas del modelo base antes de que corrompan el rastro. Sin entrenamiento requerido.
Los resultados abarcan cinco benchmarks de matemáticas en modelos Qwen2.5-Math 7B y 72B. Con presupuesto de eviction B=64, KV-Rescue recupera el 87% de la precisión perdida. En MATH500 con presupuesto 128, supera pass@1 full-KV en N=4 y mejora conforme aumenta N. Detener la degeneración reduce la generación de tokens del modelo base en un 43%.
Costo operacional: el asistente es un modelo separado de 1.5B-parámetros ejecutándose junto a la base 7B. El PRM es un tercer modelo. El costo total escala con N y presupuesto por-paso en ambos, así que los equipos ajustan N contra restricciones de latencia. El método cubre benchmarks de razonamiento matemático; el desempeño de código y documentos largos no se abordan.
Para arquitectos ejecutando eviction agresiva de KV y viendo acantilados de precisión, esto es una solución sin entrenamiento: despliegue un modelo asistente pequeño y PRM acoplado al dominio.