AI消息速览

PAWBench:距离概率对齐的世界模型还有多远?

事件日期 2026-08-27 · 学术前沿 · 已接受

事件日期2026-08-27
信息日期2026-08-27
入库日期2026-08-29
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:PAWBench:距离概率对齐的世界模型还有多远?

英文标题:PAWBench: How Far Are We from Probabilistically Aligned World Modeling?

英文关键词:Probabilistic Alignment; World Model; Video Generation; Benchmark; Distribution

一句话结论

当前视频生成模型虽然常被称作世界模型,也能生成看似合理的视频,但在“相同初始观测与动作下,多次生成的行为分布是否与真实物理可能性分布一致”上普遍未达标。

事件概述或研究问题

  • 视频生成模型正越来越多地被定位为世界模型。
  • 许多物理过程在相同条件下存在多种合法演化方式,因此世界模型不仅应生成一条合理轨迹,还应复现可能行为背后的分布。作者将此称为“概率对齐”(probabilistic alignment)。
  • 现有评测大多只评价单条视频的合理性,不检查重复生成是否恢复正确分布。
  • 核心问题:当前视频生成器距离“概率对齐的世界建模”还有多远?

方法/产品要点

  • 作者形式化定义“概率对齐”作为世界模型的分布层面准则。
  • 提出 PAWBench 基准,把视频生成器视为世界动力学的随机采样器进行评测。
  • 提出 PAWEval 协议,在“结果层面”(outcome-level)将多次视频 rollout 转换为关于可能物理行为的经验分布,再与参考概率比较。
  • 评估规模:50 个场景,11 个当前系统。
  • 在发现差距后,进一步测试语言提示、初始噪声采样或模型训练是否能重塑模型的预测分布。

主要结果或产业意义

  • 在 50 个场景和 11 个系统中,没有任何模型能既一致匹配参考概率,又恢复有效行为的完整范围。
  • 语言提示、初始噪声采样、模型训练等干预是否能改善概率对齐,摘要未给出明确结论(待核实)。
  • PAWBench 可作为未来迈向概率对齐世界建模的评估基础,有助于推动视频生成从“单一合理样本”走向“分布正确”的评测体系。

为什么重要

  • 当前对“世界模型”的评价标准还停留在视频是否逼真,忽略了世界模型的预测本质是下一时刻状态的概率分布。
  • 如果模型只能输出一种可能,而真实世界允许多种可能,则模型在规划、决策、科学模拟等应用中会产生系统性偏差。
  • 本工作给出可操作的分布级评测方法,让“概率对齐”成为可度量、可比较的研究目标。

局限与不确定性

  • 参考概率如何由真实物理过程或人工标注获得,摘要中未说明,待核实。
  • 50 个场景的具体类别、11 个系统的具体名单与版本,摘要未列出,待核实。
  • 摘要只说明“没有模型一致匹配”,未给出量化差距或部分匹配的排名,待核实。
  • 作者测试的三种干预(语言提示、初始噪声采样、模型训练)是否有效,摘要未给出结果,待核实。

可用于图书/PPT/简报的角度

  • 从“世界模型的定义之争”入手:能生成逼真视频不等于能预测世界,真正的世界模型需要学会可能性的分布。
  • 用“物理过程的多分支”比喻:同一条件可以有多种结果,而不是一条轨迹。
  • 强调评测指标的重要性:没有正确的尺子,就无法判断模型是否真的在逼近世界。
  • 可引出未来方向:如何让视频生成模型在训练中显式对齐行为分布,而不仅仅是拟合单帧像素。

与既有脉络的关系

  • 与已有关于孪生网络阈值、知识蒸馏、RoPE的卡片无直接重叠;本文更接近“视频生成作为世界模型的评估基准”这条脉络。

原始材料

  • 英文标题:PAWBench: How Far Are We from Probabilistically Aligned World Modeling?
  • arXiv ID:2608.27345v1
  • URL:https://arxiv.org/abs/2608.27345v1
  • 作者:Yuandong Pu, Le Zhuo, Sayak Paul, Gabriel Jorge Menezes, Avram Đorđević, Shiyang Li, Yifan Zhou, Bin Fu, Wenlong Zhang, Junjun He, Yu Qiao, Yihao Liu, Jingbo Xing, Xi Chen
  • 提交/更新日期:2026-08-27
  • 类别:cs.CV, cs.AI