知识卡片:ReToken:用单个Token改进视觉语言模型的视觉检索能力
一句话结论
ReToken 是一种轻量级可学习嵌入,充当显式检索目标,从预填充的视觉 KV 缓存中选取与查询相关的稀疏视觉 token;在 Visual Haystacks 上使 Qwen3VL-8B 提升 13.4 个百分点、InternVL3.5 提升 12.4 个百分点(相对提升超过 20%),并能零样本迁移到长视频场景,在 LVBench 上为 Qwen3VL-8B 带来 8.0 个百分点的增益。
事件概述或研究问题
长视觉上下文是视觉语言模型(VLM)的挑战:随着干扰物数量增加,模型性能下降;同时,在 GPU 内存限制下,一次性处理全部视觉 token 在计算上不可行。ReToken 针对“在长视觉上下文中进行视觉检索”这一问题提出改进。
方法/产品要点
- ReToken 是一个单一的可学习嵌入,被训练为显式检索目标。
- 它从一个预填充的视觉 KV 缓存中选取稀疏的、与查询相关的视觉 token。
- 该方法仅需在一个小的图像问答数据集上训练,具有轻量化设计。
- 代码已开源:https://github.com/avaxiao/ReToken
(具体训练目标、token 选择机制等细节待核实。)
主要结果或产业意义
- 在 Visual Haystacks 上:Qwen3VL-8B 提升 13.4 个百分点,InternVL3.5 提升 12.4 个百分点,相对提升超过 20%。
- 在 LVBench 上:零样本迁移至长视频,Qwen3VL-8B 获得 8.0 个百分点提升。
- 由于轻量,训练和长视频推理均可运行在单个 H100 上。
为什么重要
该工作为 VLM 在长视觉上下文中的信息获取提供了一条轻量路径:无需一次性处理全部视觉 token,而是通过一个额外可学习 token 来定位与查询相关的稀疏视觉证据。与已有卡片分别关注错误归因、语音自然度、长期准确率演变不同,本卡片补充了“长上下文视觉检索”这条具体技术路线及其在图像/视频基准上的收益。
局限与不确定性
- 当前材料仅来自 arXiv 摘要,缺少完整技术细节,例如训练数据规模、训练方式、选择 token 的阈值或可解释性。
- “小的图像问答数据集”的具体名称和规模待核实。
- Visual Haystacks、LVBench 上的提升是基于特定模型(Qwen3VL-8B、InternVL3.5)的对比结果;能否推广到其他 VLM 待核实。
- 零样本迁移到长视频的具体机制和条件待核实。
可用于图书/PPT/简报的角度
- 作为“长上下文视觉理解”难题的轻量解决案例:用一个 token 做“检索头”。
- 展示一种低资源训练范式:小数据集 + 单卡可负担的训练/推理。
- 说明可以从预填充的视觉 KV 缓存中挑选稀疏 token,而不是让模型一次性处理全部视觉 token。
- 可用于介绍视觉语言模型在长视觉上下文中检索目标信息的能力改善。
与既有脉络的关系
- 相对于已有“看不见还是不知道”的归因卡片,本条关注的是“在长视觉上下文中找到目标证据”的检索能力,并提供了一种可训练的轻量改进方法。
- 相对于十年准确率演变评估,本条给出了近期的具体工程技术增量:通过稀疏 token 选择缓解长上下文性能退化。
原始材料
- 英文标题:ReToken: One Token to Improve Vision-Language Models for Visual Retrieval
- 英文关键词:Vision-Language Models; Visual Retrieval; Long Context; KV Cache; Sparse Token Selection
- 原始来源:https://arxiv.org/abs/2607.28627v1
- arXiv ID:2607.28627v1
- 作者:Yao Xiao, Reuben Tan, Zhen Zhu, Yuqun Wu, Jianfeng Gao, Derek Hoiem
- 发布时间:2026-07-30