AI消息速览

DataOrchestra: 学习编排每个样本的预训练数据清洗流程

事件日期 2026-07-27 · 学术前沿 · 已接受

事件日期2026-07-27
信息日期2026-07-27
入库日期2026-07-28
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:DataOrchestra: 学习编排每个样本的预训练数据清洗流程

英文标题:DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data
英文关键词:pretraining data processing; per-example curation; data orchestration; LLM pretraining
原始来源:arXiv: 2607.24717v1, https://arxiv.org/abs/2607.24717v1


一句话结论

DataOrchestra 是一个为每个预训练数据样本(chunk)自适应编排处理流程的框架,在 0.5B 到 7B 模型的从头预训练中,相比单个固定处理策略在 11 项基准上取得稳定平均提升,并能在数学继续预训练场景下超越更强的基线,同时通过跳过不必要操作降低处理计算量。

事件概述或研究问题

大型语言模型(LLM)的预训练数据质量对下游性能至关重要。现有方法大多在语料库或领域层面定义固定的处理策略(如统一清洗或过滤),对所有样本采用相同操作,缺乏对每个样本具体需求的适应性。因此,如何根据每个样本的特点动态选择是否丢弃、保留或清洗,并进一步编排多个清洗操作,是一个待解决的问题。

方法/产品要点

  • 框架组成:DataOrchestra 包含一个编排器(orchestrator),对于每个预训练数据块(chunk)做出三级决策:丢弃(drop)、保留不变(untouch)或清洗(clean)。
  • 对于决定清洗的块,编排器进一步选择一个或多个下游操作,范围从程序化编辑到不同形式的基于 LLM 的重写(LLM-based rewriting)。
  • 对于每次重写步骤,编排器还生成具体的指令,由对应的下游工具模型执行。
  • 该方法将多个操作统一在一个可学习的框架内,实现对样本的自适应处理。

主要结果或产业意义

  • 从头预训练了 0.5B、1B、3B、7B 参数的 LLM,使用由 DataOrchestra 处理的网络数据,在 11 个基准上观察到比单个数据处理方法(如固定过滤、固定清洗等)稳定的平均增益。
  • 在数学继续预训练(math continued pretraining)场景中,DataOrchestra 也优于更强的处理基线。
  • 由于能跳过不必要的下游操作,整体处理计算量相比全部执行所有操作的方案显著降低。

为什么重要

  • 打破了“一刀切”的数据处理范式,首次提出每个样本独立编排处理流程,理论上能更精准地适配数据多样性和噪声分布。
  • 实验覆盖多个规模,展示了方法的通用性和可扩展性,且减少计算开销,对工业级预训练数据处理有直接实用价值。
  • 与已有知识卡片中描述的固定策略或数据增强方法不同,本框架的核心增量在于动态编排逐样本决策

局限与不确定性

  • 文章未详细披露编排器本身的训练数据来源和学习方式(是否在特定预训练任务上联合训练?);“待核实”。
  • 编排器决策的可解释性和失败案例分析未见描述;“待核实”。
  • 不同操作之间的依赖关系和执行顺序是否最优,未在摘要中讨论;“待核实”。
  • 实验仅在英文网络数据和数学数据上验证,对其他语言或领域的迁移性未知;“待核实”。

可用于图书/PPT/简报的角度

  • 数据处理智能化:从规则到学习驱动的数据清洗进化史。
  • 大模型预训练流水线:如何用“编排器”让每个数据样本获得定制处理。
  • 关注成本:DataOrchestra 在提升效果的同时降低了计算量,适合资源有限团队参考。
  • 与现有框架对比:突出“自适应”与“统一调度”两大特色。

原始材料

  • 论文标题:DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data
  • arXiv ID:2607.24717v1
  • 作者:Zhen Huang, Yikun Wang, Shijie Xia, Pengfei Liu
  • 发布日期:2026-07-27
  • 摘要链接:https://arxiv.org/abs/2607.24717v1
  • PDF 链接:https://arxiv.org/pdf/2607.24717v1