AI消息速览

Principia——视频模型的关系式物理测试基准

事件日期 2026-09-03 · 学术前沿 · 待审核

事件日期2026-09-03
信息日期2026-09-03
入库日期2026-09-05
通道学术前沿
状态待审核
来源arXiv 论文

知识卡片:Principia——视频模型的关系式物理测试基准

英文标题:Principia: Relational Physics Tests for Video Models
英文关键词:physics reasoning; video models; relational consistency; benchmark; Newtonian physics
原始来源:https://arxiv.org/abs/2609.04200v1(arXiv:2609.04200v1)

一句话结论

Principia 提出一种与相机标定无关的物理关系一致性评测框架:当同一场景中两个物体遵守同一物理定律时,它们的运动应满足可预测的关系。用该基准评测六个当前最先进的视频生成模型,所有模型的得分均不超过 0.42,而它们在 VBench 上的得分都在 0.8 左右;视觉语言模型检测物理违例的准确率也大多接近随机水平。

事件概述 / 研究问题

绝对运动测量(如速度、加速度)在生成视频中依赖帧率、物体尺度与相机标定,而这些信息在生成视频中经常缺失或不明确。针对此,作者提出转向“关系一致性”:如果两个物体受相同物理定律支配,它们的运动之间存在与标定无关的必然关系。基于这种思想构建 Principia 基准,用于评测视频模型的牛顿力学推理能力。

方法 / 产品要点

  • 以“成对物体”的关系一致性作为评测单元,避免绝对标定。
  • 覆盖 8 种物理现象:重力(gravity)、恢复系数/回弹(restitution)、摩擦(friction)、转动惯量(rotational inertia)、抛体运动(projectile motion)、动量(momentum)、摆(pendulum)、质量-弹簧振荡(mass-spring oscillation)。
  • 涉及 4 类动力学:平动(translational)、转动(rotational)、碰撞(collisional)、振荡(oscillatory)。
  • 测试数据来自在受控协议下录制的真实世界场景。
  • 提出一种与标定无关的一致性分数,直接在图像空间中量化物理违规程度。
  • 另外评估了视觉语言模型(VLMs)发现关系式物理违例的能力。

主要结果 / 产业意义

  • 在数千个生成样本上,6 个 SOTA 视频生成器在 Principia 上最高不超过 0.42;但这些模型在 VBench 上的得分都在 0.8 左右,说明常用生成质量指标可能掩盖物理推理缺陷。
  • 视觉语言模型中检测物理违例的最佳模型准确率只有 67%,多数模型接近随机水平。
  • 该基准可作为视频生成模型物理一致性的评测补充,也有助于视频理解和多模态推理系统的诊断。

为什么重要

  • 提出了一种不依赖帧率、尺度、相机参数的物理评测思路,使不同生成模型之间可以更公平地进行“物理常识”比较。
  • 定量暴露了当前视频生成模型在基本牛顿力学关系上的系统性不足,为后续改进视频基础模型提供可复现的评测维度。
  • 与已有相关卡片不同,本条不针对某一生成或预测方法,而是提供一个面向物理推理的评估基准,能够补充 VideoRAE、MotionForesight、MirrorWorld 等模型类工作所缺失的评价视角。

与既有脉络的关系

已有相关卡片主要包括:VideoRAE(利用冻结视频基础模型做表示压缩)、MotionForesight(将视频模型用于3D场景流预测)、MirrorWorld(反射感知的视频修复)。Principia 的增量在于:从“如何用视频模型完成生成/预测”转向“如何判断视频模型是否理解牛顿物理”,且通过关系一致性来规避相机标定等不确定因素。

局限与不确定性

  • 摘要未披露六个视频生成器和视觉语言模型的具体名称,具体模型名单待核实。
  • 数据规模、每类物理现象的题目数量、生成视频参数等细节待核实。
  • 受控协议下的真实场景与完全无约束的自然视频可能有差异,其生态效度需要更多验证。
  • 当前只评估摘要列出的 8 类牛顿力学现象,是否可推广到流体、弹性体或非牛顿物理仍待核实。

可用于图书/PPT/简报的角度

  • 用 Principia 的“关系一致性”思想解释:为什么即便不知道帧率和尺度,也能检测生成视频是否“目中无物理”。
  • 以“视频生成模型 VBench 高分但 Principia 低分”的反差引出 AI 评估指标的设计陷阱。
  • 可用于介绍视频生成与视频理解共用的物理世界模型评测方向。
  • 在涉及视觉语言模型的常识推理章节,可引用“最佳模型仅 67% 准确率”来说明多模态模型对视频物理违例的感知仍十分有限。

原始材料

  • 标题:Principia: Relational Physics Tests for Video Models
  • arXiv ID:2609.04200v1
  • 作者:Varun Varma Thozhiyoor, Shivam Tripathi, Venkatesh Babu Radhakrishnan, Anand Bhattad
  • 发布于:2026-09-03(更新:2026-09-03)
  • 分类:cs.CV
  • URL:https://arxiv.org/abs/2609.04200v1
  • 英文摘要:Evaluating physical reasoning in video models is difficult because absolute motion measurements depend on frame rate, object scale, and camera calibration, all of which are often ambiguous or unavailable in generated video. We propose a different approach. When two objects in the same scene obey the same physical law, their motions must satisfy predictable relationships, and these relationships hold independent of calibration. We introduce Principia, a benchmark that evaluates Newtonian physics through relational consistency between paired objects. Principia spans eight phenomena - gravity, restitution, friction, rotational inertia, projectile motion, momentum, pendulum, and mass-spring oscillation - across translational, rotational, collisional, and oscillatory dynamics, using real-world scenes recorded under controlled protocols. We also introduce a calibration-independent consistency score that quantifies physical violation directly in image space. Across thousands of generations from six state-of-the-art video generators, no model exceeds 0.42 on Principia despite all scoring around 0.8 on VBench. Vision-language models are evaluated on their ability to detect relational physics violations, with the best model achieving only 67% accuracy and most performing near chance level.