AI消息速览

可扩展的视觉预训练用于语言智能

事件日期 2026-07-10 · 学术前沿 · 已接受

事件日期2026-07-10
信息日期2026-07-10
入库日期2026-07-13
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:可扩展的视觉预训练用于语言智能

一句话结论

在相同语料上,直接对视觉文档(不提取文本)进行无监督视觉预训练,在多种骨干网络和基准上一致优于纯文本预训练,为语言智能提供了一条可扩展的新路径。

事件概述或研究问题

当前的预训练方法在处理文档、网页等视觉丰富来源时,会将其转换为纯文本,从而丢弃图表、排版方程、页面布局等视觉信息。本文质疑语言模型必须依赖纯文本训练的默认假设,系统性地研究了直接利用视觉文档的无监督视觉预训练范式。

方法/产品要点

  • 无监督视觉预训练:直接以视觉文档(如PDF、网页截图)作为输入,不进行文本提取。
  • 骨干网络:在多种视觉骨干架构上进行了实验(具体架构待核实)。
  • 训练数据:使用与文本预训练相同的底层语料库,仅保留视觉形式。

主要结果或产业意义

  • 在多个基准测试上,视觉预训练的表现一致优于纯文本预训练。
  • 表明视觉信息(如图表、公式、布局)中蕴含的语言智能知识可以通过视觉预训练有效提取,而无需依赖文本解析。
  • 为构建更强大的基础模型提供了更高效的扩展途径,尤其适用于多模态文档理解任务。

为什么重要

  • 挑战了“语言模型必须用文本训练”的主流假设,开辟了利用视觉信号提升语言智能的新方向。
  • 与现有工作(如纯文本预训练、多模态对齐)不同,本文强调预训练阶段即可从视觉文档中直接学习,无需额外的文本抽取或对齐模块。
  • 增量信息:与“已有相关卡片”中的视频/具身预训练、水印、语音评估无关,本卡片聚焦于视觉文档预训练对语言智能的促进作用。

局限与不确定性

  • 论文摘要未披露具体骨干网络架构、训练细节及计算开销,需进一步阅读全文确认。
  • 视觉预训练在纯语言任务(如纯文本问答)上的表现是否始终优于文本预训练?待核实。
  • 对于包含大量密集文本但视觉布局简单的文档,视觉预训练是否仍有优势?待核实。

可用于图书/PPT/简报的角度

  • 角度一:多模态预训练的范式转变——从“文本为主”到“视觉原生”。
  • 角度二:为什么你的语言模型需要“看图”学语言?图表与公式中的隐性知识。
  • 角度三:视觉预训练 vs. 文本预训练:同类数据、不同形态带来的性能提升。

原始材料

  • 标题:Scalable Visual Pretraining for Language Intelligence
  • 英文关键词:Scalable Visual Pretraining, Language Intelligence, Foundation Models, Visual Documents, Unsupervised Learning
  • 来源:arXiv ID 2607.09657v1,发表于 2026-07-10
  • 作者:Yiming Zhang, Zhonghan Zhao, Wenwei Zhang, Haiteng Zhao, Tianyang Lin, Yunhua Zhou, Demin Song, Kuikun Liu, Haochen Ye, Haian Huang, Yuzhe Gu, Haijun Lv, Qipeng Guo, Bin Liu, Gaoang Wang, Kai Chen
  • URL:https://arxiv.org/abs/2607.09657v1