AI消息速览

测量语言模型预训练中任务无关的训练数据影响力

事件日期 2026-08-13 · 学术前沿 · 已接受

事件日期2026-08-13
信息日期2026-08-13
入库日期2026-08-15
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:测量语言模型预训练中任务无关的训练数据影响力

一句话结论

本文提出一种不需要选定下游任务或验证集、仅依据预训练轨迹即可衡量单个训练样本影响力的方法,并在 Pythia 与 PolyPythia 的 18 种配置上发现:训练早期文学类数据与最终参数轨迹的对齐更强,后期 STEM 类数据的对齐更强。

事件概述或研究问题

在语言模型预训练中,跨时间一致地衡量训练数据影响力很困难。常见做法需要选择一个能代表模型通用能力的下游任务或验证集作为归因目标;同时,依赖中间检查点的任务表现会使不同训练阶段的比较变得复杂。该研究尝试回答:能否不依赖任何下游任务,直接度量训练数据在预训练轨迹中的影响力?

方法/产品要点

  • 提出一种任务无关(task-agnostic)的影响力度量:一个样本的影响力定义为“其梯度更新使当前参数到最终参数的平方距离减少多少”。
  • 该量可以从中间检查点估计,无需重新训练模型。
  • 不需要预先指定下游任务或验证集作为归因目标,因此可以跨训练阶段、跨模型配置进行比较。
  • 方法应用在 Pythia 和 PolyPythia 套件的 18 种配置上。

主要结果或产业意义

  • 发现训练数据影响力存在系统性的时间变化:训练早期,文学(literature)相关数据与最终参数轨迹的对齐更强;训练后期,STEM 相关数据的对齐更强。
  • 这种“定性交叉”在不同模型配置下大体一致。
  • 结果为预训练全过程中的数据影响力提供了一种可从轨迹层面观测的视角,补充了以往基于特定下游任务或验证集的影响力分析。

为什么重要

该工作不依赖具体下游任务就能追踪训练数据的影响,可能有助于理解预训练动态、改进数据配比或设计更可控的训练流程。相比已有卡片中涉及的任务感知数据选择(如 PPL-Factory)或自生成数据编码(如邀序编码),本卡片的增量信息在于:它提供了一种“任务无关、轨迹级”的影响力度量,并揭示了文学与 STEM 数据在预训练不同阶段的相对作用变化。

局限与不确定性

  • 摘要未给出具体数值结果(如影响力大小、交叉点的训练步数等),相关定量细节待核实。
  • “文学类数据”和“STEM 类数据”在原文中的具体定义、数据来源及分类标准待核实。
  • 结论在 Pythia 和 PolyPythia 套件之外是否成立,以及方法对模型规模、数据分布的依赖性,待核实。
  • 该影响力度量与真实因果贡献之间的一致性程度,摘要中未展开说明。

可用于图书/PPT/简报的角度

  • 用“训练数据在预训练不同阶段的角色变化”作为切入点,展示数据影响力并不均匀,早期与后期可能有不同数据类型占主导。
  • 对比“下游任务归因”与“任务无关轨迹归因”两种思路,说明为什么任务无关度量对预训练研究有价值。
  • 结合已有卡片,展示数据选择与数据影响力评估从“任务导向”走向“轨迹/过程导向”的趋势。

原始材料

  • 英文标题:Measuring Task-Agnostic Training Data Influence Across Language Model Pretraining
  • arXiv ID:2608.13515v1
  • 作者:Yuto Nishida, Hirokazu Kiyomaru, Yusuke Oda, Takashi Kodama, Chaoran Liu, Daisuke Kawahara, Yusuke Miyao, Max Müller-Eberstein, Masaru Isonuma
  • 发布/更新:2026-08-13T17:36:49Z
  • 主要类别:cs.CL
  • 摘要链接:https://arxiv.org/abs/2608.13515v1
  • PDF 链接:https://arxiv.org/pdf/2608.13515v1
  • 关键词:Training Data Influence; Task-Agnostic Attribution; Language Model Pretraining; Trajectory-Level Influence; Pythia; PolyPythia