AI消息速览

预训练中单个样本的“学后即忘”:一次可测量的反事实实验

事件日期 2026-08-19 · 学术前沿 · 已接受

事件日期2026-08-19
信息日期2026-08-19
入库日期2026-08-20
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:预训练中单个样本的“学后即忘”:一次可测量的反事实实验

英文标题:Learned, Then Lost: A Measured Single-Example Counterfactual in Pre-training

英文关键词:single-example counterfactual; pre-training; GPT-2; interpolation loss barrier; centered kernel alignment

一句话结论:通过在预训练中向单个 batch 行注入一段 194-token 文本,研究者直接测量了“一个训练样本”对最终模型的影响:该文本在注入后很快被模型“学会”,但到训练结束时其对模型输出的可检测影响已消失;不过,模型的权重轨迹被永久改变,只是仍停留在同一个损失盆地内。

事件概述或研究问题

单个训练样本对最终模型的贡献通常只能“估计”而无法“测量”,因为要直接测量,需要做两次完整的预训练,而两次训练之间仅在一个 batch 的一行上存在差异。本文在较小规模上把这种反事实实验真正跑了出来:训练了 32 个 124M 参数的 GPT-2 模型(在 OpenWebText 上),共 4 种条件、8 个随机种子。在总训练步数 9,536 步中的第 200 步(峰值学习率时),将一个 256 行 batch 中的一行替换为固定上下文注入,携带一段 194-token 的文章。

方法/产品要点

  • 训练设置:32 个 GPT-2 模型,参数量 124M,从头开始在 OpenWebText 上训练;4 种条件 × 8 个种子,总步数 9,536 步。
  • 注入方式:在第 200 步、峰值学习率处,将一个 194-token 段落注入到一个 batch 的一行中。
  • 三种注入条件:① 流畅散文,主语在语料中可考证(真实);② 流畅散文,主语为虚构,但与条件①的全文 batch 梯度差匹配在 0.14% 以内;③ 随机键盘字符。
  • 第四种条件:未注入的孪生模型(对照组)。
  • 测量指标:注入后 50 步与最终步的段落交叉熵、插值损失屏障、留出集交叉熵、逐层 centered kernel alignment(CKA)、权重位移等。

主要结果或产业意义

  • 注入后 50 步,见过段落的模型比未见过段落的模型在该段落上的交叉熵低 0.039 和 0.044 nats,8/8 个种子均成立,p < 10⁻⁴。
  • 到训练最终步,两个段落的这一差异均不可检测(p = 0.25 和 p = 0.71,最小可检测效应分别为 0.025 和 0.079 nats);两种注入段落之间的差异也不可检测(p = 0.54)。
  • 预注册的插值损失屏障对比为 +0.0068,p = 0.509,最小可检测效应为 0.032 屏障单位。
  • 留出集交叉熵差异为 -0.00044,p = 0.310,无显著影响。
  • 逐层 CKA 在任意层都没有检测到可分离的表示差异。
  • 注入引起的权重位移达到种子间欧氏距离的 44.1%,且在训练中点时已安定 92%;而注入导致的损失屏障仅为种子间屏障的 3.0%;两者相差约 15 倍,且这是“下界”。
  • 结论表述:注入将模型在其损失盆地内重新定位,但没有把它移到另一个盆地。

为什么重要

这项研究第一次直接“测量”而不是“估计”了单个训练样本对预训练最终模型的影响。它提供了一个定量证据:单一文本样本可能在预训练过程中被短期记住,但最终对模型行为几乎没有可检测的残留影响;同时,模型权重轨迹仍被明显改变,且这种改变不损害泛化或表征结构。该结果对数据影响估计、机器遗忘、训练数据贡献分析等领域有参考意义,也与“预训练只是把模型留在同一个盆地”这类几何直觉相呼应。

局限与不确定性

  • 实验规模较小:模型为 124M 参数,总训练步数仅 9,536 步,与大规模预训练存在差距。
  • 只在训练早期的一个时间点(第 200 步,峰值学习率)做了注入,未覆盖其他阶段。
  • “未检测到差异”不等于“差异不存在”,摘要中给出了最小可检测效应范围。
  • 注入文本为 194-token 段落,batch 大小为 256,单样本影响可能随 batch 规模、学习率调度、模型规模等变化。
  • 关于优化器、学习率具体值、训练数据细节等,摘要未完整披露,标注为待核实。

可用于图书/PPT/简报的角度

  • “单个训练样本在预训练中能留下多深的印记?——一项直接测量实验。”
  • “学得很快,忘得也快:大模型预训练中的单样本记忆衰退。”
  • “为什么数据影响估计那么难?因为直接反事实需要训练两遍模型。”
  • “损失盆地视角:一次注入如何‘移动’模型却不让它离开盆地。”
  • “从反事实实验看预训练的可解释性与数据遗忘。”

原始材料

  • 英文标题:Learned, Then Lost: A Measured Single-Example Counterfactual in Pre-training
  • arXiv ID:2608.19168v1
  • 作者:Zachary Speck, Asa Shepard
  • 发布时间:2026-08-19
  • 原始 URL:https://arxiv.org/abs/2608.19168v1