知识卡片:Zero-WAM——以人类视频为上下文指令的开放任务泛化机器人操作模型
- 英文标题:Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization
- 英文关键词:zero-shot cross-task generalization; in-context learning; robot manipulation; human video; video-action model
- 原始来源:arXiv:2608.26103v1(cs.RO, cs.CV),https://arxiv.org/abs/2608.26103v1
一句话结论
Zero-WAM 提出一种以人类操作视频作为“上下文指令”的因果视频-动作模型,让机器人零样本执行训练中从未见过的操作任务,在 RoboTwin 2.0 的 7 个未见任务上平均成功率达到 47.0%。
事件概述或研究问题
研究问题:机器人操作中的零样本跨任务泛化——如何在训练时未见过某任务的情况下,让策略直接执行该任务?
核心观察:大语言模型可以通过上下文中的任务描述完成新任务,无需更新参数。作者将该范式迁移至机器人操作,认为操作任务的天然上下文规范不是语言,而是“人类视频”,因为它能提供任务演变的丰富视觉线索。
方法/产品要点
- Zero-WAM:一个因果视频-动作模型,通过跟随上下文中的人类视频引导来执行未见任务。
- HumanGen 数据集构建:提出自动流水线,将任务采样的机器人轨迹转换为语义匹配的人类视频,生成包含 74.2K 个人类-机器人上下文学习(ICL)对、覆盖 8.6K 任务的数据集。
- 上下文未来块预测(IFP)目标:用于抑制从已见任务中学到的捷径,迫使策略从视频提示中提取任务信息。
主要结果或产业意义
- 在 RoboTwin 2.0 仿真中 7 个未见任务上:平均成功率 47.0%,比最强的 video-action 基线绝对提升 29.5 个百分点。
- 真实世界评估中:能够跟随人类视频指导,泛化到多物体场景、长时程操作和精细插入等未见任务配置。
为什么重要
该工作把“上下文学习”从语言模型扩展到机器人操作,并用人类视频替代语言作为任务规范,为开放世界任务泛化提供了新范式。相比已有相关卡片中的 Surgical WAM(以无动作内窥镜视频预训练手术操作模型),Zero-WAM 的增量信息在于:它不依赖任务对应的动作示范,而是直接用人类视频作为推理时的任务提示,并贡献了一个大规模人类-机器人上下文学习数据集。
局限与不确定性
- 摘要未说明 Zero-WAM 的模型架构、参数量、训练计算成本等细节,待核实。
- 当前仿真评测仅覆盖 7 个未见任务,真实世界任务的具体类别、成功率数值、失败模式尚未在摘要中给出,待核实。
- IFP 目标的具体实现方式、对模型收敛和泛化的定量影响,待核实。
- HumanGen 自动流水线如何保证“语义匹配”的准确性,以及是否引入噪声,摘要未提供评估,待核实。
可用于图书/PPT/简报的角度
- 把大语言模型“上下文学习”的思想迁移到机器人操作:用人类视频作为任务指令。
- 数据稀缺问题的高效解法:自动生成人类-机器人 ICL 配对数据集 HumanGen(8.6K 任务、74.2K 对)。
- 从“见过才能做”到“看过就能做”:零样本跨任务泛化的结果与意义。
- 机器人操作基础模型的新方向——视频即指令。
原始材料
- 标题:Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization
- arXiv ID:2608.26103v1
- 作者:Jiaming Zhou, Qihang Zhang, Gangwei Xu, Cunxin Fan, Yujie Zhao, Ruilin Wang, Yiming Luo, Shuai Yang, Xing Zhu, Yujun Shen, Junwei Liang, Yinghao Xu
- 提交/更新日期:2026-08-26
- 摘要链接:https://arxiv.org/abs/2608.26103v1
- PDF 链接:https://arxiv.org/pdf/2608.26103v1