论文提出 Latent Dynamics Reasoning(LDR),把视频潜在状态的时间演化建模为显式运动学积分:低阶动力学由数值积分完成,模型只回归三阶及以上残差;在 PhyWorld 白盒物理基准上,LDR 的分布内/分布外误差差距比视频扩散基线小 20 倍以上,论文称其为首个能外推所学动态的视频世界模型。
当前领先的视频扩散模型主要拟合像素,而没有显式建模像素或潜在状态如何随时间变迁,因此能生成视觉上合理的帧,但不一定遵守物理规律。LDR 的动机是从纯像素观测中学习世界动力学,并检验其能否外推到训练分布之外。