AI消息速览

PPL-Factory: 从语言建模到推理的任务感知与预算感知数据选择

事件日期 2026-07-20 · 学术前沿 · 已接受

事件日期2026-07-20
信息日期2026-07-20
入库日期2026-07-22
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:PPL-Factory: 从语言建模到推理的任务感知与预算感知数据选择

英文标题:PPL-Factory: Task-Aware and Budget-Aware Data Selection from Language Modeling to Reasoning
英文关键词:PPL-Factory, task-aware data selection, budget-aware data selection, perplexity, fine-tuning, reasoning

一句话结论

PPL-Factory 通过结合任务感知的困惑度评分与预算感知的选择标准,在仅使用 1% 训练数据时即超越现有数据选择方法;使用 10% 数据时在 GSM8K 和 MATH 上分别超全数据微调精度 0.9 和 4.8。

事件概述 / 研究问题

大语言模型微调中,不同训练样本对下游性能的贡献不均。高效数据选择可降低计算成本,但现有方法多依赖间接启发式(如质量、多样性、推理链长度),这些固定标准难以泛化到不同任务。基于困惑度的选择虽简单且模型感知,但现有工作对整个序列统一评分,忽略了语言建模与推理任务在学习目标上的差异。本文提出的 PPL-Factory 旨在解决任务相关性与预算约束下的样本选择问题。

方法 / 产品要点

PPL-Factory 是一个简单且可解释的数据选择框架,包含两个核心组件:

  • 任务感知困惑度评分(Task-aware Perplexity Score):根据任务类型(语言建模 vs. 推理)分别计算每个样本的困惑度,而非对全序列使用统一指标。
  • 预算感知选择标准(Budget-aware Selection Criteria):依据给定的数据预算(如训练集大小的 1% 或 10%)动态筛选样本。

(具体评分公式与选择算法细节未在摘要中展开,待核实。)

主要结果或产业意义

  • 在 GSM8K 基准上,仅用 1% 训练集即超越其他 SOTA 数据选择方法。
  • 使用 10% 数据时,在 GSM8K 上准确率超过全数据微调 0.9 个百分点,在 MATH 上超过 4.8 个百分点。
  • 表明该方法能在显著降低计算开销的同时,甚至超越全数据训练的效果,对资源受限场景下的模型部署具有实际价值。

为什么重要

以往困惑度驱动的数据选择未区分任务学习目标,PPL-Factory 首次在框架中显式融入任务感知与预算感知,且保持简单可解释。相比依赖间接启发式的方法(如质量或多样性过滤),本方法更直接关联模型自身不确定性,并针对推理任务做了专门调整。与既有脉络的关系:相较于“重采样 vs 重路由”和“复杂度感知执行”等侧重推理阶段或测试时分配的工作,本文聚焦于微调阶段的数据筛选,增量在于证明“任务感知 + 预算感知”的困惑度策略可兼顾高效与高性能,是困惑度数据选择方向的重要改进。

局限与不确定性

  • 实验仅覆盖 GSM8K 和 MATH 两个数学推理基准,对代码、翻译、问答等任务的泛化性待核实。
  • 困惑度作为样本难度的代理指标,可能受模型初始化、训练步骤等因素影响,鲁棒性待进一步分析。
  • 预算感知的具体机制(如阈值选取、排序策略)未在摘要中详述,可能存在超参数敏感性。
  • 与全数据训练相比的额外开销(如评分计算成本)未给出量化对比。

可用于图书 / PPT / 简报的角度

  • 案例:展示“少即是多”——仅用 1% 数据超越 SOTA 选择方法,凸显任务导向样本筛选的价值。
  • 方法论:如何将任务差异(语言建模 vs 推理)转化为可操作的数据选择规则,提供可复现的设计思路。
  • 对比:全数据训练 vs. 10% 数据增强训练的性能反超,启发从业者重新评估数据规模与质量的关系。
  • 扩展:结合预算约束的权衡思想可推广至其他深度学习微调场景(如视觉模型、多模态)。

原始材料

  • arXiv 论文 ID:2607.18199v1
  • 标题:PPL-Factory: Task-Aware and Budget-Aware Data Selection from Language Modeling to Reasoning
  • 作者:Hang Zhang, Warren J. Gross
  • 发布日期:2026-07-20
  • PDF 链接:https://arxiv.org/pdf/2607.18199v1