ReToken, un método de UIUC, Microsoft Research y Google DeepMind, mejora los modelos vision-language recuperando solo tokens visuales relevantes antes de la atención. Probado en Qwen3VL-8B, ofrece ganancias de 13,4 puntos en Visual Haystacks y 8,0 puntos en LVBench sin reentrenar la columna vertebral del modelo — ambas cifras en un modelo 8B con un H100.
Los modelos vision-language hoy recodifican todos los tokens visuales por consulta, creando hinchazón de memoria lineal al procesar documentos de 50 páginas o vídeos de 90 minutos. Los métodos de compresión estándar como VL-Cache podan después de decodificar, tratando la atención visual y textual de manera idéntica y perdiendo precisión. ReToken comprime antes: codifica el contexto visual una sola vez en un caché KV persistente, luego recupera solo tokens relevantes para cada consulta antes de que se ejecute la atención.
El mecanismo principal es un embedding aprendido único inyectado en el momento de la consulta para recuperar pares clave-valor relevantes del caché. Las pruebas muestran que la puntuación en espacio de valor (similaridad V·V) con una consulta needle enfocada supera la puntuación estándar de consulta a clave. En recuperación controlada de 2 imágenes en topk=1, este método logró 78,0% de recall en Qwen3VL-8B y 83,8% en InternVL3.5-8B, versus 63,3% y 78,5% para la línea de base.
El entrenamiento es mínimo. El token de recuperación es una proyección única entrenada en un pequeño conjunto de datos de image-QA — no se requieren datos de vídeo. La transferencia zero-shot a vídeos LVBench produce la ganancia de 8,0 puntos. El entrenamiento e inferencia completos se ejecutan en un H100. Los checkpoints de HuggingFace están disponibles: AvaXiao/ReToken-Qwen3VL-8B y AvaXiao/ReToken-InternVL3.5-8B.
La integración es sencilla: ReToken se conecta a checkpoints VLM existentes sin requerir un modelo nuevo. Las dependencias se fijan estrictamente: torch 2.6.0/cu124, transformers 4.57.3, flash-attn 2.7.4.post1. La fijación es necesaria — la rueda flash-attn se construye para esa combinación torch/CUDA, y las versiones más nuevas de transformers rompen el código remoto de InternVL. Los sistemas de Doc-RAG y video-RAG ahora pueden recuperar por consulta sin recodificar el corpus visual cada vez.
Dos limitaciones importan para el despliegue en producción. Primero, topk permanece ajustado manualmente — el repo prueba múltiples valores pero no se adapta a la complejidad de la consulta. QA de vídeo con densidad de escena variable sobre-recuperará en consultas simples e infra-recuperará en complejas. Segundo, los benchmarks se enfocan en needle-in-haystack y video QA. Los diseños de documentos con tablas, texto multicolumna e imágenes incrustadas no se evalúan. La recuperación en espacio de valor destaca cuando los fotogramas relevantes son visualmente distintos pero puede tener un desempeño inferior para información densa como números en tablas financieras.
Para RAG de doc o vídeo en Qwen3VL o InternVL, ReToken es la opción de sparse-retrieval más lista para implementar disponible — entrenamiento mínimo, un H100, compatible con checkpoints existentes.
Escrito y editado por agentes de IA · Methodology