知识卡片:RP-OPSD——推理支点引导的同策略自蒸馏用于多语言推理迁移
- 英文标题:RP-OPSD: Reasoning-Pivot-Guided On-Policy Self-Distillation for Multilingual Reasoning Transfer
- 英文关键词:multilingual reasoning transfer; on-policy self-distillation; reasoning pivot; privileged distillation; reference anchoring
- 原始来源:arXiv:2608.06347v1 [cs.CL],Xinye Wang, Junxiao Liu, Shujian Huang,2026-08-06
- 原文链接:https://arxiv.org/abs/2608.06347v1
一句话结论
RP-OPSD 提出用“推理支点”来引导同策略自蒸馏:先区分目标语言推理中的“表面文本”与“推理支点”,再用教师视图在有/无英文参考解时的分布偏移来定位这些关键决策,从而在数学推理基准上优于强多语言推理基线和已有 OPSD 变体。
研究问题
多语言推理迁移旨在把大语言模型的推理能力从高资源语言扩展到低资源语言。已有 OPSD 及其变体虽能在学生生成的采样输出上提供 token 级稠密监督,但它们的训练目标没有显式优先考虑对跨语言迁移最关键的推理信号。本文认为,目标语言推理实际上包含两类生成内容:一是表面文本,二是“推理支点”——即推进或重定向推理过程、并塑造后续推理走向的决策。
方法/产品要点
- 将目标语言推理分解为“表面文本生成”与“推理支点生成”。
- 用“匹配教师视图在有/无英文参考解两种条件下的分布偏移”,作为识别推理支点的操作化代理。
- 基于该代理引导“特权蒸馏”和“参考锚定”,使蒸馏损失更集中在推理支点 token 上。
- 代码已开源:https://github.com/NJUNLP/RP-OPSD
主要结果或产业意义
- 在覆盖 17 种语言、多个难度级别的数学推理基准上,RP-OPSD 超过强多语言推理基线和若干 OPSD 变体。
- 进一步分析显示,RP-OPSD 会将特权蒸馏集中到“推理控制”和“问题条件状态更新”类 token 上,同时降低主要支撑表面实现的 token 的权重。
- “具体数据集名称、模型规模、性能数值、消融实验细节”等,摘要中未给出,待核实。
为什么重要
- RP-OPSD 为“在 rollouts 中哪些 token 应被重点蒸馏”提供了新的选择标准:不是简单按位置或概率加权,而是按是否属于推理支点。
- 该方法的识别信号不要求显式标注推理支点,而是用“有/无英文参考解”的教师分布偏移作为代理,这对多语言推理训练具有实用性。
- 本卡片的增量信息是:已有 β-OPSD 侧重从训练目标角度调节参考策略与特权教师的权重;RP-OPSD 则进一步回答在特权蒸馏中应把高权重放在哪些 token 上。
局限与不确定性
- 摘要仅报告了“优于强基线和 OPSD 变体”,未给出具体评测集、数值、误差棒、模型规模等,待核实。
- “匹配教师视图”的具体构建方式、英文参考解在推理时是否必须可得、不同语言对上的稳定性,摘要中均未展开,待核实。
- 对该方法在非数学推理任务上的表现,摘要未涉及,待核实。
可用于图书/PPT/简报的角度
- 用“推理支点”解释“多语言推理不是翻译”:跨语言迁移的关键是抓住决定推理走向的决策点。
- 用“有/无英文参考解的教师分布偏移”说明如何在不标注支点的情况下发现关键推理信号。
- 可联系多语言 LLM 训练实践:复用高资源语言解题思路作为对照视图,引导低资源语言推理能力提升。
原始材料
- 标题:RP-OPSD: Reasoning-Pivot-Guided On-Policy Self-Distillation for Multilingual Reasoning Transfer
- arXiv ID:2608.06347v1
- 作者:Xinye Wang, Junxiao Liu, Shujian Huang
- 发布时间:2026-08-06T17:52:06Z
- 分类:cs.CL
- 摘要链接:https://arxiv.org/abs/2608.06347v1
- PDF 链接:https://arxiv.org/pdf/2608.06347v1