在扩展到 100B token 规模的评估中,先让语言模型在“形式推导(formal derivations)”数据上进行前置预训练(Logic-PPT),能显著加速自然语言技能习得:达到 80% 准确率比标准初始化少用 36B token;并且这种训练方式带来的内部表征几何特征,使模型在约 33% 稀疏度剪枝下仍能匹配密集基线性能。
现有“前置预训练”(pre-pretraining)常使用 Dyck 语言、程序化算法等符号任务,虽然能加速自然语言获取,但所用原语较窄,不足以覆盖自然语言的表达能力。 先前研究多在较小 token 预算下进行,难以可靠观察技能涌现与表征动态。 本文提出 **逻辑前置预训练(Logic-PPT)**,用形式推导作为初始化策略,使模型先学习与自然语言高度相关…