知识卡片:预训练期间的知识获取?大语言模型借助辅助视图学习得更好
一句话结论
该研究通过受控实验提出并验证:在大语言模型(LLM)预训练中,将同一知识以不同表述形式呈现的“辅助视图”(auxiliary views)对知识获取有因果性的帮助;在 token 预算固定的情况下,把原本用于文档重复的 token 分配给辅助视图,反而能提升学习效果,甚至包括事实性回忆。
事件概述或研究问题
研究者指出,关于大语言模型在预训练阶段如何获取知识,目前仍存在理解空白。他们提出一个假设:辅助视图(即对同一知识的重新表述/改写)是学习的因果促进因素,而非仅仅依赖原始文本的重复。为了验证这一点,他们设计了受控实验,试图把“重复”和“多样化表述”两种效应分离开来。
方法/产品要点
- 采用受控实验设计,聚焦预训练阶段的知识获取。
- 系统比较文档重复(document repetition)与辅助视图(auxiliary views)对学习效果的影响。
- 固定 token 预算,考察 token 分配策略(用于重复还是用于辅助视图)如何影响模型表现。
- 使用不同强度的教师模型生成辅助视图,以检验辅助视图效果是否依赖生成者质量。
- 进一步分析模型逐层(layer-wise)的偏置与压缩现象,以观察辅助视图产生作用的机制。
主要结果或产业意义
- 确认重复是知识获取的必要条件;同时澄清:改写/释义(paraphrasing)只在较小的 batch size 下有帮助。
- 在固定 token 预算的前提下,将 token 从文档重复转移到辅助视图可以改善学习,这一结果与直觉相反,且在事实性回忆任务上仍然成立。
- 辅助视图的有效性并不依赖于生成它们的教师模型是否强大。
- 识别出有助于在已有知识缺口背景下促进学习的知识形式,即“情境性知识”(contextual)和“基础性知识”(foundational)。
- 机制层面,这些效应表现为逐层偏置与压缩方面的变化。
- 作者认为,辅助视图在大型预训练语料库中自然出现,可能是预训练成功的关键因素之一,为“数据多样性为何重要”提供了可能解释。
为什么重要
已有相关卡片主要涉及自动算法发现、价值观对齐和认知障碍检测,均未关注预训练阶段知识获取的内部机制。本卡片的增量信息在于:它提出了一个可验证的因果解释——数据多样性之所以有助于预训练,可能是因为多样化的知识表述(辅助视图)本身促进了知识获取,而不只是提供了更多覆盖或重复。这为优化预训练数据配比、生成训练文本和设计数据混合策略提供了新思路。
局限与不确定性
- 摘要中未提供具体实验规模、数据集、模型参数数量、测试基准等细节,因此以下内容待核实:实验使用的具体模型系列、token 预算数值、batch size 区间、辅助视图生成方式、教师模型与模型强度的量化标准。
- “情境性知识”和“基础性知识”的精确定义与判定标准,待核实。
- “逐层偏置与压缩”的具体测量指标和代码发布情况,待核实。
- 结论是否能在真实大规模语料库上直接推广,仍需更多验证。
可用于图书/PPT/简报的角度
- 打破直觉:想学得更快,不一定反复读原文,换一种说法反而更好用——即使是在“背事实”任务上。
- 数据配比启示:预训练中“重复 token” vs “改写 token”存在最优分配问题。
- 对数据清洗与合成数据策略:辅助视图不一定需要顶级教师模型生成,弱模型生成的改写也能有效。
- 机制线索:逐层偏置和压缩可能用于追踪知识如何在大模型内部形成。
原始材料
- 英文标题:Knowledge Acquisition During Pre-training? Large Language Models Learn Better With Auxiliary Views
- 英文关键词:auxiliary views; knowledge acquisition; pre-training; data diversity; controlled experiments
- 来源:arXiv:2609.04180v1 [cs.CL, cs.AI](作者:Joseph Lee, Yidi Huang, Dokyoon Kim, Shu Yang, Li Shen;提交/更新于 2026-09-03)
- URL: https://arxiv.org/abs/2609.04180v1