知识卡片:从文本语料学习人类语言的一个形式化局限
英文标题: A Formal Limitation on Learning Human Language From Textual Corpora
英文关键词(提取自摘要): formal limitation; human language learning; textual corpora; information-theoretic bounds; meaning recovery; large language models
一句话结论
听者无法仅从话语形式(utterance form)完全恢复说话者的意图;无论使用多少文本数据、多少监督信号,任何文本表示(包括当代大语言模型的隐藏状态)在解码意图时都会受到形式对意义内在不确定性的上界限制。
事件概述或研究问题
这篇论文用一个信息论框架回答了一个经典问题:一个听者能否仅凭话语的形式本身,就确定说话者想表达的意义?作者将语言使用建模为“意义—语境—话语”的联合分布,并从理论上推导出:从话语表征中恢复说话者意图的成功概率存在上界。该上界适用于任意文本特征化器(featurizer),因此也适用于大语言模型。
方法/产品要点
- 将语言使用形式化为联合分布:意义(meaning)、语境(context)、话语(utterance)。
- 推导解码器从话语表征恢复说话者意图的概率上界。
- 上界由“形式对意义的不确定性”决定,该不确定性可拆分为:
- 不可约部分(irreducible part);
- 只有语言外语境(extralinguistic context)才能解决、话语本身永远无法单独解决的部分。
- 理论结论对所有文本表示成立,无论意义空间是离散还是连续,也无论表示由多少文本或监督训练得到。
主要结果或产业意义
- 理论上证明:纯文本语料对大语言模型的“意义学习”存在信息论层面的不可逾越边界。
- 实验在人工语言、中文零代词消解和颜色指称上展开,结果支持该理论。
- 产业意义:单纯扩大文本数据规模或增加文本级监督,无法让模型真正学到超出形式歧义的意义;语言外信息(如视觉、身体经验、交互语境)可能是继续提升的必需方向。
为什么重要
- 这是对“用海量文本训练即可让模型理解意义”这一主流信念的形式化挑战。
- 它把意义歧义从工程难题上升为信息论必然,有助于界定大语言模型能力的真实边界。
- 与已有相关卡片的关系:本卡片不讨论训练策略或评估框架,而是从信息论角度给出“纯文本学习”的负面边界;这与“逻辑先于语言”中的前置预训练收益、荷兰政府评估中的模型取舍均不重复,可视为对LLM能力边界的另一层增量认识。
局限与不确定性
- 摘要未给出具体上界数值或实验量化结果,相关数字待核实。
- “意义”和“语境”的数学定义是否覆盖自然语言全貌,待核实。
- 人工语言、中文零代词消解和颜色指称实验的具体规模、设置、数据集细节,待核实。
- 作者单位、完整方法细节、论文是否经过同行评审,待核实。
可用于图书/PPT/简报的角度
- 论题:为什么“让AI读遍所有文本”仍不足以让AI理解世界?
- 信息论视角下的语言歧义:不可约不确定性 vs. 可由语境消除的不确定性。
- 对“扩展定律”(scaling law)的信息论提醒:文本数据扩展不能解决所有意义恢复问题。
- 对多模态、具身AI的启示:语言外语境是意义还原的关键补充。
原始材料
- 英文标题:A Formal Limitation on Learning Human Language From Textual Corpora
- arXiv ID:2608.28560v1
- 作者:Emily Cheng, Ryan Cotterell
- 提交/更新日期:2026-08-28T17:38:24Z
- 主要分类:cs.CL
- 原始来源:https://arxiv.org/abs/2608.28560v1
- PDF 链接:https://arxiv.org/pdf/2608.28560v1