AI消息速览

CLAP:跨具身视频世界模型作为零样本物理模拟器

事件日期 2026-08-27 · 学术前沿 · 已接受

事件日期2026-08-27
信息日期2026-08-27
入库日期2026-08-28
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:CLAP:跨具身视频世界模型作为零样本物理模拟器

一句话结论

CLAP 提出一种可同时在人类与机器人视频上训练的动作条件视频生成框架,通过末端执行器位姿、语言指令和潜在动作统一异构动作空间,并采用“先学通用物理先验、再注入具体动作空间”的课程式两阶段训练,使模型在 DROID 等挑战性环境中接近或超过单具身 SOTA 模型,并能在真实任务上零样本部署。

事件概述或研究问题

  • 现有 SOTA 动作条件视频模型通常只针对单一机器人形态训练,难以利用海量、异构的互联网视频数据中蕴含的通用物理规律。
  • 跨具身学习的主要障碍是动作表示在不同机器人平台间差异很大,且人类视频通常没有动作标注。
  • CLAP 的出发点是“无论执行者是谁,时空动态都受通用物理定律支配”,因此尝试把人类和机器人视频统一用于学习具身物理模拟器。

方法/产品要点

  • 统一动作空间:CLAP 使用三类信号来弥合动作空间差异——末端执行器位姿、语言指令和潜在动作。
  • 课程式跨具身学习方案
    1. 先在无标注视频数据上通过潜在动作学习基础物理先验;
    2. 再将学到的物理先验“落地”到末端执行器动作空间,用于零样本真实世界部署。
  • 开源:作者称将开源全部代码和模型;项目网站为 https://omni-clap.github.io 。

主要结果或产业意义

  • 在 DROID 等挑战性环境中,CLAP 接近或超越当前单具身视频世界模型的 SOTA 水平(具体数值待核实)。
  • 通过少样本适应,这些性能优势可以进一步累积,为训练单具身视频世界模型提供了新范式。
  • 作者称这是迄今最全面的动作条件视频世界模型套件,覆盖末端执行器、语言、潜在动作等多种动作条件空间,以及跨具身、DROID、Bridge、双臂 YAM 机器人、G1 人形机器人等多种形态。
  • 产业意义:若成立,机器人系统可把视频世界模型当作零样本物理模拟器,减少对真实机器人交互数据的依赖,并利用互联网视频获得更通用的物理先验。

为什么重要

  • 展示了“跨具身动作条件视频生成”的可行性:不再为每个机器人平台单独训练世界模型,而是先构建通用物理先验,再适配具体动作空间。
  • 将人类视频和机器人视频统一在同一个框架下,扩大了世界模型可学习的物理经验范围。
  • 零样本部署与少样本适应的组合,可能使视频世界模型成为机器人策略学习、规划和仿真的基础模块。

与既有脉络的关系

  • 已有卡片中 Cycle-World 关注的是自回归视频生成中的长期误差累积问题;CLAP 关注的是动作条件视频模型在多具身/跨具身场景下的动作空间统一与零样本物理模拟,两者问题不同。
  • SpectraReward 属于文本到图像生成的奖励模型方向,与本文无直接继承关系;CLAP 属于动作条件视频世界模型/机器人基础模型方向。
  • “视频生成模型作为光照估计器”这一条侧重从视频中估计光照;CLAP 则以动作为条件生成未来视频,强调物理模拟器角色,视角不同。
  • 本条不是已有卡片的直接更新,而是“视频世界模型”这一脉络中新增的跨具身维度。

局限与不确定性

  • 本卡片仅基于 arXiv 摘要和元数据制作;具体模型架构、训练数据规模、定量评估结果均未在摘要中给出,待核实。
  • “接近或超越 SOTA”“最全面套件”“零样本部署”等是作者在摘要中的表述,需要阅读全文或复现验证,待核实。
  • 潜在动作在无标注视频上如何学习、课程式训练的具体实现、真实机器人部署条件等细节,待核实。
  • 论文为 arXiv v1,是否经过同行评审待核实。

可用于图书/PPT/简报的角度

  • “视频世界模型 = 零样本物理模拟器”:将视频生成从“画未来帧”转向“可被动作控制的物理环境”。
  • “人类视频也是机器人训练数据”:跨具身学习让互联网视频成为机器人基础模型的数据来源。
  • “课程式两阶段训练”:先学通用物理,再学具体执行器,是具身基础模型的一种可行配方。
  • “从专用到通用再到专用”:跨具身预训练 + 少样本微调,形成单具身视频世界模型的新范式。

原始材料

  • English Title: CLAP: Cross-Embodiment Video World Models are Zero-Shot Physical Simulators
  • English Keywords(按摘要提炼): action-conditioned video generation; cross-embodiment; world models; zero-shot physical simulator; end-effector poses; language instructions; latent actions
  • Original Source: https://arxiv.org/abs/2608.27406v1
  • PDF: https://arxiv.org/pdf/2608.27406v1
  • arXiv ID: 2608.27406v1
  • Authors: Kechen Liu, Ola Shorinwa
  • Published: 2026-08-27T17:35:10Z
  • Primary Category: cs.RO
  • Categories: cs.RO, cs.AI, cs.CV
  • Track: academic
  • Topics: foundation-model