知识卡片:Copy Less, Ground More:通过证据感知强化学习克服长上下文推理中的重复复制问题
英文标题:Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning
英文关键词:long-context reasoning; repetitive copying; evidence-aware reinforcement learning; reward shaping; grounding
一句话结论
本文发现大语言模型在长上下文推理中普遍存在“重复复制”行为(从输入中大量复制文本而非解决问题),其根源是模型未能充分聚焦于关键证据;提出的 GEAR 方法通过引入证据感知奖励(奖励关键证据重叠、惩罚无关上下文重叠)在多个规模上平均提升 +4.6 分,且长上下文场景下增益更大。
事件概述或研究问题
- 研究问题:大语言模型在执行长上下文推理任务时,会生成逐步推理链,但存在一种关键失败模式——重复复制(repetitive copying),即模型大量复制输入中的文本而非进行有效推理。该行为在前沿长上下文 LLM 中普遍存在,且随上下文长度增加而加剧。
- 通过将每个提示分解为任务相关的关键证据(key evidence)和无关干扰上下文(distractor context),发现根本原因是模型接地不足(insufficient grounding):模型不加区分地复制输入,那些未能聚焦于关键证据的模型更可能给出错误答案。
方法/产品要点
- GEAR(Grounding Evidence-Aware Reward):一种奖励塑造方法,在准确率信号基础上增加:
- 接地奖励(grounding reward):奖励推理链与关键证据的重叠;
- 干扰惩罚(distractor penalty):惩罚与无关上下文的重叠。
- 为实现 GEAR,开发了自动化流水线,能从任意文档构建带有证据标注的训练数据。
- 验证场景:多个模型规模和基准测试,标准 RL(仅基于准确率奖励)作为基线。
主要结果或产业意义
- 在多个模型规模和基准上,GEAR 相对于标准 RL 实现了一致的改进,平均提升 +4.6 分,在更长的上下文中增益更大。
- 同时减少了重复复制行为和推理链长度(thinking length)。
- 产业意义:表明即使在长上下文评估从简单检索转向复杂推理的背景下,准确接地于相关证据仍然是不可或缺的能力,且存在较大的改进空间。
为什么重要
- 揭示了长上下文 LLM 中一种被低估的失败模式(重复复制),并提供了系统性诊断。
- 提出了轻量级的强化学习奖励塑造方案,无需修改模型架构即可缓解该问题。
- 与既有同类工作(如 CompactionRL 通过压缩历史轨迹训练)不同,GEAR 聚焦于推理过程中的证据选择与接地,是一种互补思路。
局限与不确定性
- 自动化证据标注流水线的质量和覆盖范围待核实(未在摘要中详细说明,需进一步阅读全文确认)。
- 实验仅在部分基准和模型规模上验证,未报告在超长上下文(如 128K+ token)上的具体表现。
- 干扰惩罚可能过于严格,对于某些需要引用原文的推理任务是否产生负面影响待核实。
- 论文收录于 arXiv,尚未经过正式同行评审。
可用于图书/PPT/简报的角度
- “长上下文 LLM 的‘复制粘贴’陷阱:为何模型会在推理中机械拷贝输入?”
- “给奖励函数装上‘证据雷达’:GEAR 方法如何引导模型少抄录、多推理。”
- “从检索到推理:接地能力仍是长上下文 AI 的核心瓶颈。”
原始材料
- URL:https://arxiv.org/abs/2607.19345v1
- 来源:arXiv(2026-07-25,版本 v1)
- 基于摘要信息生成;正文细节待进一步核实。