AI消息速览

从文本语料学习人类语言的一个形式化局限

事件日期 2026-08-28 · 学术前沿 · 已接受

事件日期2026-08-28
信息日期2026-08-28
入库日期2026-08-31
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:从文本语料学习人类语言的一个形式化局限

英文标题: A Formal Limitation on Learning Human Language From Textual Corpora
英文关键词(提取自摘要): formal limitation; human language learning; textual corpora; information-theoretic bounds; meaning recovery; large language models

一句话结论

听者无法仅从话语形式(utterance form)完全恢复说话者的意图;无论使用多少文本数据、多少监督信号,任何文本表示(包括当代大语言模型的隐藏状态)在解码意图时都会受到形式对意义内在不确定性的上界限制。

事件概述或研究问题

这篇论文用一个信息论框架回答了一个经典问题:一个听者能否仅凭话语的形式本身,就确定说话者想表达的意义?作者将语言使用建模为“意义—语境—话语”的联合分布,并从理论上推导出:从话语表征中恢复说话者意图的成功概率存在上界。该上界适用于任意文本特征化器(featurizer),因此也适用于大语言模型。

方法/产品要点

  • 将语言使用形式化为联合分布:意义(meaning)、语境(context)、话语(utterance)。
  • 推导解码器从话语表征恢复说话者意图的概率上界。
  • 上界由“形式对意义的不确定性”决定,该不确定性可拆分为:
    • 不可约部分(irreducible part);
    • 只有语言外语境(extralinguistic context)才能解决、话语本身永远无法单独解决的部分。
  • 理论结论对所有文本表示成立,无论意义空间是离散还是连续,也无论表示由多少文本或监督训练得到。

主要结果或产业意义

  • 理论上证明:纯文本语料对大语言模型的“意义学习”存在信息论层面的不可逾越边界。
  • 实验在人工语言、中文零代词消解和颜色指称上展开,结果支持该理论。
  • 产业意义:单纯扩大文本数据规模或增加文本级监督,无法让模型真正学到超出形式歧义的意义;语言外信息(如视觉、身体经验、交互语境)可能是继续提升的必需方向。

为什么重要

  • 这是对“用海量文本训练即可让模型理解意义”这一主流信念的形式化挑战。
  • 它把意义歧义从工程难题上升为信息论必然,有助于界定大语言模型能力的真实边界。
  • 与已有相关卡片的关系:本卡片不讨论训练策略或评估框架,而是从信息论角度给出“纯文本学习”的负面边界;这与“逻辑先于语言”中的前置预训练收益、荷兰政府评估中的模型取舍均不重复,可视为对LLM能力边界的另一层增量认识。

局限与不确定性

  • 摘要未给出具体上界数值或实验量化结果,相关数字待核实。
  • “意义”和“语境”的数学定义是否覆盖自然语言全貌,待核实。
  • 人工语言、中文零代词消解和颜色指称实验的具体规模、设置、数据集细节,待核实。
  • 作者单位、完整方法细节、论文是否经过同行评审,待核实。

可用于图书/PPT/简报的角度

  • 论题:为什么“让AI读遍所有文本”仍不足以让AI理解世界?
  • 信息论视角下的语言歧义:不可约不确定性 vs. 可由语境消除的不确定性。
  • 对“扩展定律”(scaling law)的信息论提醒:文本数据扩展不能解决所有意义恢复问题。
  • 对多模态、具身AI的启示:语言外语境是意义还原的关键补充。

原始材料

  • 英文标题:A Formal Limitation on Learning Human Language From Textual Corpora
  • arXiv ID:2608.28560v1
  • 作者:Emily Cheng, Ryan Cotterell
  • 提交/更新日期:2026-08-28T17:38:24Z
  • 主要分类:cs.CL
  • 原始来源:https://arxiv.org/abs/2608.28560v1
  • PDF 链接:https://arxiv.org/pdf/2608.28560v1