知识卡片:YOPO——在冻结语言模型的单次前向传播中同时回答与弃权
英文标题:You Only Pass Once: Answering and Abstaining Together in a Single Forward Pass of a Frozen Language Model
英文关键词:frozen language model; residual stream; abstention; steering; single forward pass
一句话结论
YOPO 在不改变冻结大语言模型权重的前提下,用一个小型残差重构网络解决“引导写入”与“充分性判读”互相干扰的问题,使模型在单次前向传播中既能回答也能弃权;在 Qwen2.5 1.5B 的 alphaNLI 上,三路准确率从冻结基线的 0.375 提升到 0.798,并超过需要两次前向传播的参照方案。
事件概述 / 研究问题
- 论文认为,冻结语言模型在推理任务上有两个相互关联的弱点:一是没有充分使用自身残差流中已经编码的证据;二是当输入信息不足以回答时不能识别,从而产生“编造式回答”(confabulation)。
- 已有两条研究路线分别作用于同一条残差流:
- 条件引导探针(conditional steering probe)在中段层写入残差流,提升冻结主干的推理准确率;
- 零样本充分性方向(zero-shot sufficiency direction)读取残差流,在信息不足时弃权。
- 但当两者在同一个前向传播中部署时会相互干扰:引导写入会改变充分性方向所读取的状态,在小模型上造成最多 8 个 AUROC 点的跨域迁移损失;若分开做一次“干净前向传播”,推理成本会翻倍。
- YOPO 的做法是:固定充分性方向,训练一个小网络从“被引导后的残差”重构“引导前的残差”,再在重构结果上读取充分性方向,从而在一次前向传播内同时完成回答、引导和弃权。
方法/产品要点
- 主干:冻结的 Qwen2.5 模型,规模为 1.5B / 3B / 7B。
- 三个关键组件:
- 条件引导探针:在残差流中段层写入信息;
- 零样本充分性方向:读取残差流,判断输入信息是否足以回答;
- 小型重构网络:以“被引导后的残差”和“引导前的干净残差”作为训练对,使用均方误差(MSE)学习重构;不需要充分性标签。
- 推理流程:冻结模型只进行一次前向传播;在被引导后的残差上,先由小网络重构出接近引导前的状态,再由固定的充分性方向决定是否弃权。
主要结果或产业意义
- 在 Qwen2.5 1.5B 的 alphaNLI 上,three-way accuracy(三路准确率,摘要未展开定义)从冻结基线的 0.375 提升到 0.798,超过两倍。
- 单次前向传播在三个规模上均优于两次前向传播的参照方案:0.798 / 0.830 / 0.893,对比参照方案的 0.753 / 0.790 / 0.863。
- 在十个主干、六个模型家族上复现了这一优势。
- 在标准的四域测试套件上,论文称贡献了“首个回答或弃权基准”(first answer-or-abstain benchmark);其“门控”(gate)在每个域内数据集上表现最佳,而标签无关的充分性方向是唯一在域迁移后仍然有效的门控家族。
- 潜在产业意义:在冻结的已有模型上实现低成本的“回答或弃权”,可以避免为“拒答”单独再跑一遍模型,同时减少幻觉式输出带来的风险。
为什么重要
- 大多数方案要么提高模型回答能力,要么训练模型拒答;YOPO 把“引导推理”和“知道何时弃权”放在同一条残差流上,并证明两者的干扰可以被一个小型重构网络吸收。
- 它强调一个原则:弃权不应被“训练进模型”(abstention should not be trained in);相反,可以通过读取残差流中的充分性信号实现弃权。
- 与已有相关卡片相比,这条不是讨论代码模型表征分离、视觉语言模型准确率或自修复,而是聚焦“冻结大语言模型的可靠推理 + 拒答机制”,增量信息在于“单次前向传播”和“无充分性标签的重构方案”。
局限与不确定性
- 摘要提到作者自己的 alphaNLI 构造被源端审计发现存在表面伪影(surface artifact),因此架构层面的结论以原生标签复制(SQuAD2、RepLiQA、MuSiQue)为准;但该表面伪影的具体内容待核实。
- “三路准确率”(three-way accuracy)的精确计算方式在摘要中未展开,待核实。
- “容量-迁移前沿”(capacity-transfer frontier)的具体指标、图表和量化口径未在摘要中提供,待核实。
- “标准四域测试套件”的具体名称与数据集构成未在摘要中列出,待核实。
- 论文摘要未说明是否提供开源代码、模型权重,以及是否经过同行评审,这些均待核实。
- 摘要没有量化重构网络本身带来的额外计算开销,也未讨论相比“两次前向传播”在实际延迟和吞吐上的完整权衡,待核实。
可用于图书/PPT/简报的角度
- 用“一次前向传播”切入:既要模型会推理,也要模型懂“不知道”,但不必为“弃权”再跑一遍模型。
- 结构图思路:输入 → 冻结主干一次前向 → 中层写入引导 → 小网络重构残差 → 充分性方向决定回答或弃权 → 输出。
- 反直觉点:不是训练一个弃权分类器,而是训练一个小网络还原“被引导前”的残差,再用固定方向读取充分性。
- 部署口号:一次前向,既答又拒;不用为“不知道”跑两遍模型。
与既有脉络的关系
- 已有相关卡片分别覆盖代码模型表征、视觉语言模型准确性、冻结小代码模型的自修复;本条是“冻结模型上的推理与弃权”,不重复它们的具体事实。
- 本条可视为“用残差流内部状态做轻量可靠化”的延续:它不改变冻结主干,而是用轻量组件在单次前向内同时提升回答能力和补充弃权机制。
原始材料
- 英文标题:You Only Pass Once: Answering and Abstaining Together in a Single Forward Pass of a Frozen Language Model
- arXiv ID:2608.14465v1
- URL:https://arxiv.org/abs/2608.14465v1
- PDF:https://arxiv.org/pdf/2608.14465v1
- 作者:Ziyang Luo, Zhongyao Chu, Xinjie He, Youting Wang, Xukui Qin, Runxiong Wu, Yan-Syuan Chen
- 提交/更新日期:2026-08-14
- 分类:cs.CL, cs.LG
- 原始来源:arXiv 摘要页及摘要文本。