知识卡片:为补全监督推理训练设计广泛的程序化数据
英文标题:Reasoning Core: Designing Broad Procedural Data for Completion-Supervised Reasoning Training
英文关键词:Procedural data generation; Completion-supervised fine-tuning; Reasoning training; Semantic scoring; Data auditing
中文关键词:程序化数据生成;补全监督微调;推理训练;语义评分;数据审计
一句话结论
程序化生成器可以规模化产出可验证推理问题,但“语义上有效”并不等于“对训练有用”。Reasoning Core 通过 50 个生成器、语义评分器、难度控制和审计流程,在 3B 规模的主要补全监督对比中,于 DROP、LogiQA、ARC-Challenge 上取得最高平均分,超过无程序化数据基线和三个替代程序化数据集合。
事件概述 / 研究问题
程序化生成器能够产生大量可验证的推理问题,但作为“补全监督微调”数据,受到的关注较少。Reasoning Core 研究的问题是:如何设计广泛的程序化数据,使其在补全监督推理训练中真正有效,而不仅仅是在规模上可行。
方法 / 产品要点
- 提出 Reasoning Core,包含 50 个程序化生成器,覆盖数学、逻辑、规划、状态跟踪、形式语言、结构化数据、游戏、因果和代码。
- 每个生成器配有语义评分器、难度控制和任务评估器。
- 在匹配的补全监督协议下,跨 4 个基础模型设置和多种训练时长,与 Procedural Warmup、Reasoning Gym、SynLogic 三个程序化数据集合进行对比。
- 开发过程中采用了结合模型辅助审查、人工裁决和回归测试的审计流程,并同样应用于其他对比集合。
主要结果 / 产业意义
- 在主要的 3B 规模对比中,Reasoning Core 在 DROP、LogiQA、ARC-Challenge 上取得最高平均分,超过无程序化数据基线和三个替代程序化集合。
- 任务级分析显示:语义有效性本身不足以保证训练效用;“紧凑目标”和“校准难度”是重要的数据设计因素。
- 审计发现生成、渲染、目标、评分之间存在细微失配,说明程序化生成本身并不能保证正确性。
- 代码库、生成的数据集和审计材料公开可用,对于构建可扩展、可验证的合成推理数据流水线具有工程参考意义。
为什么重要
Reasoning Core 的价值不在于简单提供更多合成数据,而在于把“程序化生成数据”当作需要精细设计的训练资源来研究。它明确指出:除了语义正确性,目标文本的紧凑性和难度校准也会显著影响训练效用。此外,审计流程揭示了生成到评分全链路中的隐藏失配问题,为后续合成数据工作提供了质量控制思路。
与既有脉络的关系
已有相关卡片分别涉及户型图生成中的域偏移、零售机器人 VLA 数据后训练、机器学习原子间势训练的优化器。本条不是对上述内容的重复,而是从“程序化生成推理数据”和“数据审计”角度提供增量信息,尤其补充了“语义有效性不等于训练效用”这一观察。
局限与不确定性
- 本卡片仅基于 arXiv 摘要整理;具体生成器示例、数据集规模、模型名称、训练时长、评测细节等均待核实。
- “最高平均分”是否在所有模型设置下都成立,摘要未明确说明;其他三个模型设置的具体结果待核实。
- 审计过程中发现的失配案例和具体影响程度,摘要未展开,待核实。
- 公开资源的获取方式和许可证等信息,需从 arXiv 页面或对应代码库进一步确认。
可用于图书 / PPT / 简报的角度
- “合成数据不是越多越好”:语义正确之外,还需要考虑目标紧凑度与难度校准。
- “程序化生成不自动等于正确”:生成、渲染、目标、评分之间可能出现系统性的微妙失配。
- “可验证推理数据可以很广泛”:数学、逻辑、规划、状态跟踪、形式语言、游戏、因果等均可作为推理训练数据来源。
- “数据审计是合成数据工程的一部分”:模型辅助审查、人工裁决和回归测试可以用于发现数据管线中的隐藏问题。
原始材料
- 英文标题:Reasoning Core: Designing Broad Procedural Data for Completion-Supervised Reasoning Training
- arXiv ID:2608.05148v1
- 作者:Damien Sileo, Valentin Lacombe, Dimitri Kachler
- 提交 / 更新时间:2026-08-05
- 主分类:cs.CL
- 来源:https://arxiv.org/abs/2608.05148v1
- PDF:https://arxiv.org/pdf/2608.05148v1