AI消息速览

ReWEIGH——用Token级序数视觉证据校准以缓解大视觉语言模型的幻觉

事件日期 2026-08-19 · 学术前沿 · 已接受

事件日期2026-08-19
信息日期2026-08-19
入库日期2026-08-21
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:ReWEIGH——用Token级序数视觉证据校准以缓解大视觉语言模型的幻觉

英文关键词:Hallucination; Large Vision-Language Models; Decoding Intervention; Token-Level Ordinal Visual Evidence; Calibration

一句话结论:ReWEIGH是一种无需训练的推理时解码干预方法,通过聚合视觉位置的词汇排名并与token特定参考比较,仅对证据不足的候选施加有界惩罚,在多个7B LVLM上使幻觉物体提及最多减少21.3%,且平均每token延迟仅增加1.33%。

事件概述或研究问题:大视觉语言模型(LVLM)经常产生输入图像不支持的幻觉内容。要在解码时抑制幻觉,需要一种候选专用的度量,判断当前token受到图像支持的程度。论文提出从模型的视觉token状态中提取证据:将每个视觉位置的状态通过输出头投影,可以揭示该位置更偏好哪些词汇项。但这些位置级读数不能直接合并,因为概率量级在不同视觉位置间不可比较。词汇排名提供了尺度不变的基础,但不同token在典型排名证据上仍存在系统性差异。

方法/产品要点

  • 视觉证据来源:利用视觉token状态经输出头投影得到的词汇偏好。
  • 序数排名:用词汇排名替代原始概率,解决跨视觉位置不可比的聚合问题。
  • Token特定参考:从未标注图像估计每个token的典型排名证据,以校正token间的系统性差异。
  • 推理时操作:在prefill阶段缓存图像证据;仅对低于参考的候选施加有界惩罚(bounded penalty),其余候选不受影响。
  • 无需训练:ReWEIGH是完全推理时的解码干预,不需要微调或额外训练。

主要结果或产业意义

  • 在4个7B基座模型上,幻觉物体提及最多减少21.3%,同时基本保持或改善了描述能力和通用表现。
  • 在缓存证据后,平均每token增加延迟1.33%。
  • 效果扩展到6种架构家族,最大可达32B参数。
  • 具体基座模型名称、架构家族列表、评估基准和数据集待核实。

为什么重要

  • 提供一种轻量级、无需训练的幻觉抑制方案,可能适合已有LVLM直接部署。
  • 通过“序数视觉证据+token特定参考”,绕开了跨视觉位置概率不可比较的难点。
  • 与已有相关卡片中的ReToken不同,ReWEIGH处理的是解码阶段的幻觉抑制,而非视觉token检索;增量在于利用词汇排名做无训练校准,并展示了跨架构的扩展性。

与既有脉络的关系:本文与ReToken分别处理LVLM的视觉信息使用与生成可靠性:ReToken侧重通过可学习嵌入改进稀疏视觉token检索,ReWEIGH侧重在不训练的前提下降低解码时的幻觉。本卡片补充了关于LVLM幻觉缓解的文献脉络,尤其强调低延迟、免训练的推理时干预方向。

局限与不确定性

  • 摘要未提供4个7B基座模型的具体名称、6种架构家族列表、评估数据集,待核实。
  • “token特定参考”从未标注图像估计的具体流程和统计量(如均值、分位数)未在摘要中展开,待核实。
  • “有界惩罚”的具体形式(阈值设定、惩罚强度)未在摘要中描述,待核实。
  • 所有数值均来自论文摘要,独立复现情况未知。

可用于图书/PPT/简报的角度

  • 标题参考:不训练也能减少LVLM幻觉:给每个token一把“视觉证据尺”。
  • 可提炼三要点:视觉排名而非概率、token特定参考校准、有界惩罚加缓存加速。
  • 图示建议:左侧展示模型在缺乏图像支持时产生幻觉;右侧展示ReWEIGH如何对低于参考的候选降权。

原始材料

  • 英文标题:ReWEIGH the Evidence: Calibrating Token-Level Ordinal Visual Evidence to Mitigate Hallucinations in Large Vision-Language Models
  • arXiv ID:2608.19075v1
  • 作者:Jihae Jeong, Junha Choi, Hwanjo Yu
  • 发布时间:2026-08-19T16:23:56Z
  • URL:https://arxiv.org/abs/2608.19075v1
  • PDF:https://arxiv.org/pdf/2608.19075v1