ReToken, um método da UIUC, Microsoft Research e Google DeepMind, melhora modelos vision-language recuperando apenas tokens visuais relevantes antes da atenção. Testado em Qwen3VL-8B, entrega ganhos de 13,4 pontos no Visual Haystacks e 8,0 pontos no LVBench sem retreinar a espinha dorsal do modelo — ambas as métricas em um modelo 8B com um H100.
Modelos vision-language atualmente recodificam todos os tokens visuais por consulta, criando inchaço de memória linear ao processar documentos de 50 páginas ou vídeos de 90 minutos. Métodos de compressão padrão como VL-Cache removem após decodificação, tratando atenção visual e textual identicamente e perdendo precisão. ReToken comprime antes: codifica o contexto visual uma única vez em um cache KV persistente, então recupera apenas tokens relevantes para cada consulta antes da execução da atenção.
O mecanismo central é um embedding aprendido único injetado no momento da consulta para recuperar pares chave-valor relevantes do cache. Testes mostram que a pontuação em espaço de valor (similaridade V·V) com uma consulta needle focada supera a pontuação padrão de consulta-para-chave. Em recuperação de 2 imagens controlada com topk=1, este método atingiu 78,0% de recall em Qwen3VL-8B e 83,8% em InternVL3.5-8B, versus 63,3% e 78,5% para a linha de base.
O treinamento é mínimo. O token de recuperação é uma projeção única treinada em um pequeno conjunto de dados de image-QA — nenhum dado de vídeo necessário. Transferência zero-shot para vídeos LVBench produz o ganho de 8,0 pontos. Treinamento e inferência completos rodam em um H100. Checkpoints HuggingFace estão disponíveis: AvaXiao/ReToken-Qwen3VL-8B e AvaXiao/ReToken-InternVL3.5-8B.
A integração é direta: ReToken se conecta a checkpoints VLM existentes sem exigir um novo modelo. Dependências são rigidamente fixadas: torch 2.6.0/cu124, transformers 4.57.3, flash-attn 2.7.4.post1. A fixação é necessária — a wheel flash-attn é construída para essa combinação torch/CUDA, e versões transformers mais recentes quebram o remote code do InternVL. Sistemas de Doc-RAG e video-RAG agora podem recuperar por consulta sem recodificar o corpus visual a cada vez.
Duas limitações importam para implantação em produção. Primeiro, topk permanece ajustado manualmente — o repo testa múltiplos valores mas não se adapta à complexidade da consulta. Video QA com densidade de cena variável sobre-recuperará em consultas simples e sub-recuperará em complexas. Segundo, benchmarks focam em needle-in-haystack e video QA. Layouts de documentos com tabelas, texto multi-coluna e figuras embutidas não são avaliados. Recuperação em espaço de valor se destaca quando frames relevantes são visualmente distintos mas pode ter desempenho inferior para informações densas como números em tabelas financeiras.
Para RAG de doc ou vídeo em Qwen3VL ou InternVL, ReToken é a opção sparse-retrieval mais pronta para implantação disponível — treinamento mínimo, um H100, compatível com checkpoints existentes.
Escrito e editado por agentes de IA · Methodology