知识卡片:学习何时信任——选择性上下文偏好优化
英文标题:Learning When to Trust via Selective Context Preference Optimization
英文关键词:Selective Trust; Context Preference Optimization; DPO; MIST; SC2W; SCOPE
一句话结论
大语言模型面对外部上下文时,目标不应只是“抵抗误导”,也不应“照单全收”,而是学会“选择性信任”。论文提出 MIST 基准、SC2W 指标和 SCOPE 方法,在降低误导性上下文导致答错率的同时,保留对可信上下文的合理利用。
事件概述或研究问题
语言模型越来越依赖外部信号来生成答案,例如检索结果、工具输出或用户附加上下文。一条误导性上下文,就可能让原本正确的回答变成错误。常见的对策是训练模型抵抗这类信号,但这可能让模型无视所有上下文——表面鲁棒,实则无法利用值得信任的信息。本文将问题重新定义为“选择性信任”(selective trust)。
方法/产品要点
- MIST:人工标注基准,把每个推理条目放在四种匹配条件下呈现:
- clean(干净条件)
- misleading(误导条件)
- correct-context(正确上下文条件)
- irrelevant-context(无关上下文条件)
- SC2W:配对指标,统计“clean 条件下回答正确,但 misleading 条件下回答错误”的比例,量化误导信号把正确答案翻转的程度。
- SCOPE(Selective Context Preference Optimization):
- 挖掘 clean-correct / misleading-wrong 的失败样本;
- 使用标准 DPO(Direct Preference Optimization)目标;
- 偏好对在四种条件下等量均衡配对,而不是只对误导样本训练。
主要结果或产业意义
- 在综合基准研究中,误导上下文导致答错的现象具有普遍性。
- SCOPE 能大幅降低主流开源模型的 SC2W。
- 同时,在附加上下文为干净、正确或无关时,模型准确率基本保持。
- 对 RAG、智能体工具调用、检索增强生成等依赖外部上下文的系统,这意味着模型需要“知道该信谁”,而不是简单地屏蔽外部信息。
为什么重要
- 现有鲁棒性评测往往只考察“是否抵抗误导信息”,容易让“忽略一切上下文”的模型获得虚假高分。
- 本文提出“选择性信任”作为评估视角:既要抵抗误导,又要保留对可信上下文的使用,更贴近真实部署。
- 与既有脉络的关系:已有相关卡片分别关注长上下文推理中的重复复制、特权信息轨迹训练等;本条目的增量在于把“对外部上下文的选择性信任”作为核心问题,并提出相应的基准、指标和四条件均衡 DPO 策略。
局限与不确定性
- 摘要未提供 MIST 的样本量、任务类型和数据集来源,待核实。
- 未列出具体测试了哪些开源模型、SC2W 具体下降多少,待核实。
- 未说明 SCOPE 与“完全忽略上下文”类强鲁棒基线的定量比较,待核实。
- 未给出 DPO 超参数、训练成本、数据规模等实现细节,待核实。
- 未讨论误导信息与正确信息高度相似或混合时,方法是否仍然有效,待核实。
可用于图书/PPT/简报的角度
- 概念角度:从“鲁棒性”到“选择性信任”——AI 是否该信外部信息。
- 指标角度:SC2W 提供可量化的“误导翻转率”,可用于检索增强系统的风险监测。
- 方法角度:四条件均衡的偏好对构造,可作为 DPO 类训练中避免“矫枉过正”的示例。
- 案例角度:一条误导性检索片段足以让正确模型答错,凸显外部上下文治理的重要性。
原始材料
- 英文标题:Learning When to Trust via Selective Context Preference Optimization
- 英文关键词:Selective Trust; Context Preference Optimization; DPO; MIST; SC2W; SCOPE
- 原始来源:https://arxiv.org/abs/2608.06377v1
- arXiv ID:2608.06377v1
- Authors: Xian Sun, Wei Chow, Yingshuo Wang, Junhao Liu, Wei Gao, Qing Wu, Lingdong Kong
- Published: 2026-08-06
- Primary category: cs.CL
- Categories: cs.CL, cs.AI, cs.LG
- Abstract URL:https://arxiv.org/abs/2608.06377v1
- PDF URL:https://arxiv.org/pdf/2608.06377v1