知识卡片:DataOrchestra: 学习编排每个样本的预训练数据清洗流程
英文标题:DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data
英文关键词:pretraining data processing; per-example curation; data orchestration; LLM pretraining
原始来源:arXiv: 2607.24717v1, https://arxiv.org/abs/2607.24717v1
一句话结论
DataOrchestra 是一个为每个预训练数据样本(chunk)自适应编排处理流程的框架,在 0.5B 到 7B 模型的从头预训练中,相比单个固定处理策略在 11 项基准上取得稳定平均提升,并能在数学继续预训练场景下超越更强的基线,同时通过跳过不必要操作降低处理计算量。
事件概述或研究问题
大型语言模型(LLM)的预训练数据质量对下游性能至关重要。现有方法大多在语料库或领域层面定义固定的处理策略(如统一清洗或过滤),对所有样本采用相同操作,缺乏对每个样本具体需求的适应性。因此,如何根据每个样本的特点动态选择是否丢弃、保留或清洗,并进一步编排多个清洗操作,是一个待解决的问题。
方法/产品要点
- 框架组成:DataOrchestra 包含一个编排器(orchestrator),对于每个预训练数据块(chunk)做出三级决策:丢弃(drop)、保留不变(untouch)或清洗(clean)。
- 对于决定清洗的块,编排器进一步选择一个或多个下游操作,范围从程序化编辑到不同形式的基于 LLM 的重写(LLM-based rewriting)。
- 对于每次重写步骤,编排器还生成具体的指令,由对应的下游工具模型执行。
- 该方法将多个操作统一在一个可学习的框架内,实现对样本的自适应处理。
主要结果或产业意义
- 从头预训练了 0.5B、1B、3B、7B 参数的 LLM,使用由 DataOrchestra 处理的网络数据,在 11 个基准上观察到比单个数据处理方法(如固定过滤、固定清洗等)稳定的平均增益。
- 在数学继续预训练(math continued pretraining)场景中,DataOrchestra 也优于更强的处理基线。
- 由于能跳过不必要的下游操作,整体处理计算量相比全部执行所有操作的方案显著降低。
为什么重要
- 打破了“一刀切”的数据处理范式,首次提出每个样本独立编排处理流程,理论上能更精准地适配数据多样性和噪声分布。
- 实验覆盖多个规模,展示了方法的通用性和可扩展性,且减少计算开销,对工业级预训练数据处理有直接实用价值。
- 与已有知识卡片中描述的固定策略或数据增强方法不同,本框架的核心增量在于动态编排与逐样本决策。
局限与不确定性
- 文章未详细披露编排器本身的训练数据来源和学习方式(是否在特定预训练任务上联合训练?);“待核实”。
- 编排器决策的可解释性和失败案例分析未见描述;“待核实”。
- 不同操作之间的依赖关系和执行顺序是否最优,未在摘要中讨论;“待核实”。
- 实验仅在英文网络数据和数学数据上验证,对其他语言或领域的迁移性未知;“待核实”。
可用于图书/PPT/简报的角度
- 数据处理智能化:从规则到学习驱动的数据清洗进化史。
- 大模型预训练流水线:如何用“编排器”让每个数据样本获得定制处理。
- 关注成本:DataOrchestra 在提升效果的同时降低了计算量,适合资源有限团队参考。
- 与现有框架对比:突出“自适应”与“统一调度”两大特色。
原始材料
- 论文标题:DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data
- arXiv ID:2607.24717v1
- 作者:Zhen Huang, Yikun Wang, Shijie Xia, Pengfei Liu
- 发布日期:2026-07-27
- 摘要链接:https://arxiv.org/abs/2607.24717v1
- PDF 链接:https://arxiv.org/pdf/2607.24717v1