AI消息速览

学习何时信任——选择性上下文偏好优化

事件日期 2026-08-06 · 学术前沿 · 已接受

事件日期2026-08-06
信息日期2026-08-06
入库日期2026-08-07
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:学习何时信任——选择性上下文偏好优化

英文标题:Learning When to Trust via Selective Context Preference Optimization
英文关键词:Selective Trust; Context Preference Optimization; DPO; MIST; SC2W; SCOPE

一句话结论

大语言模型面对外部上下文时,目标不应只是“抵抗误导”,也不应“照单全收”,而是学会“选择性信任”。论文提出 MIST 基准、SC2W 指标和 SCOPE 方法,在降低误导性上下文导致答错率的同时,保留对可信上下文的合理利用。

事件概述或研究问题

语言模型越来越依赖外部信号来生成答案,例如检索结果、工具输出或用户附加上下文。一条误导性上下文,就可能让原本正确的回答变成错误。常见的对策是训练模型抵抗这类信号,但这可能让模型无视所有上下文——表面鲁棒,实则无法利用值得信任的信息。本文将问题重新定义为“选择性信任”(selective trust)。

方法/产品要点

  • MIST:人工标注基准,把每个推理条目放在四种匹配条件下呈现:
    • clean(干净条件)
    • misleading(误导条件)
    • correct-context(正确上下文条件)
    • irrelevant-context(无关上下文条件)
  • SC2W:配对指标,统计“clean 条件下回答正确,但 misleading 条件下回答错误”的比例,量化误导信号把正确答案翻转的程度。
  • SCOPE(Selective Context Preference Optimization)
    • 挖掘 clean-correct / misleading-wrong 的失败样本;
    • 使用标准 DPO(Direct Preference Optimization)目标;
    • 偏好对在四种条件下等量均衡配对,而不是只对误导样本训练。

主要结果或产业意义

  • 在综合基准研究中,误导上下文导致答错的现象具有普遍性。
  • SCOPE 能大幅降低主流开源模型的 SC2W。
  • 同时,在附加上下文为干净、正确或无关时,模型准确率基本保持。
  • 对 RAG、智能体工具调用、检索增强生成等依赖外部上下文的系统,这意味着模型需要“知道该信谁”,而不是简单地屏蔽外部信息。

为什么重要

  • 现有鲁棒性评测往往只考察“是否抵抗误导信息”,容易让“忽略一切上下文”的模型获得虚假高分。
  • 本文提出“选择性信任”作为评估视角:既要抵抗误导,又要保留对可信上下文的使用,更贴近真实部署。
  • 与既有脉络的关系:已有相关卡片分别关注长上下文推理中的重复复制、特权信息轨迹训练等;本条目的增量在于把“对外部上下文的选择性信任”作为核心问题,并提出相应的基准、指标和四条件均衡 DPO 策略。

局限与不确定性

  • 摘要未提供 MIST 的样本量、任务类型和数据集来源,待核实。
  • 未列出具体测试了哪些开源模型、SC2W 具体下降多少,待核实。
  • 未说明 SCOPE 与“完全忽略上下文”类强鲁棒基线的定量比较,待核实。
  • 未给出 DPO 超参数、训练成本、数据规模等实现细节,待核实。
  • 未讨论误导信息与正确信息高度相似或混合时,方法是否仍然有效,待核实。

可用于图书/PPT/简报的角度

  • 概念角度:从“鲁棒性”到“选择性信任”——AI 是否该信外部信息。
  • 指标角度:SC2W 提供可量化的“误导翻转率”,可用于检索增强系统的风险监测。
  • 方法角度:四条件均衡的偏好对构造,可作为 DPO 类训练中避免“矫枉过正”的示例。
  • 案例角度:一条误导性检索片段足以让正确模型答错,凸显外部上下文治理的重要性。

原始材料

  • 英文标题:Learning When to Trust via Selective Context Preference Optimization
  • 英文关键词:Selective Trust; Context Preference Optimization; DPO; MIST; SC2W; SCOPE
  • 原始来源:https://arxiv.org/abs/2608.06377v1
  • arXiv ID:2608.06377v1
  • Authors: Xian Sun, Wei Chow, Yingshuo Wang, Junhao Liu, Wei Gao, Qing Wu, Lingdong Kong
  • Published: 2026-08-06
  • Primary category: cs.CL
  • Categories: cs.CL, cs.AI, cs.LG
  • Abstract URL:https://arxiv.org/abs/2608.06377v1
  • PDF URL:https://arxiv.org/pdf/2608.06377v1