知识卡片:FlowWAM:面向世界动作模型的光流统一动作表示
英文标题
FlowWAM: Optical Flow as a Unified Action Representation for World Action Models
英文关键词
FlowWAM, Optical Flow, World Action Models, Dual-stream diffusion framework, Action representation, Video-native representation
一句话结论
FlowWAM 通过采用光流作为统一的视频原生动作表示,在世界动作模型(WAM)的策略模式与世界模型模式上均取得显著提升,在 RoboTwin 操控任务中成功率超过 92%,在 WorldArena 世界建模中轨迹精度相对提升 18.4%。
事件概述或研究问题
World Action Models (WAMs) 利用预训练视频生成器同时进行世界建模与动作预测。然而,如何以与视频生成器对齐且携带足够运动线索的形式表示动作是一大挑战。现有数值动作表示无法与视频生成器自然对齐,而视觉动作表示则忽略了帧间的时序运动结构。FlowWAM 旨在解决这一动作表示难题。
方法/产品要点
- 双流扩散框架:FlowWAM 采用光流作为统一、视频原生的动作表示。光流视频与 RGB 视频格式相同,蕴含丰富的逐像素位移信息。
- 共享预训练视频生成器:将 RGB 视频与光流视频在同一个预训练视频生成器中联合建模,天然实现两种模式:
- 策略模式:生成光流用于动作预测。
- 世界模型模式:利用目标光流序列引导未来 RGB 视频的生成。
- 无标签数据利用:光流可从原始视频中直接提取而无需动作标签,因此 FlowWAM 可利用大规模无标签视频数据集进行预训练。
主要结果或产业意义
- RoboTwin 操控任务:
- Clean 设置:成功率 92.94%
- Random 设置:成功率 92.14%
- 均优于 VLA 和 WAM 基线。
- WorldArena 世界建模:
- 总体 EWMScore 达 63.71,轨迹精度相对提升 18.4%。
- 表明基于光流的动作表示能有效提升机器人操控与世界建模的性能,并为利用无标注视频数据训练 WAM 提供了可行路径。
为什么重要
现有 WAM 研究多关注如何利用视频生成器,但忽视了动作表示本身的对齐问题。FlowWAM 首次提出将光流作为视频原生表示,统一了策略生成与世界模型的输入形态,同时利用光流无需标签的特性突破了对标注数据的依赖。该工作为后续将大规模无标签视频预训练与机器人控制结合提供了新范式。
局限与不确定性
- 材料中未提及模型在复杂、高动态场景下的泛化能力,例如多物体交互或快速运动的鲁棒性。
- 光流估计本身存在误差,该误差对下游任务的具体影响程度待进一步验证。
- 模型的推理速度、计算开销以及在实际机器人系统上的部署细节均未在摘要中说明。
- 仅在 RoboTwin 和 WorldArena 两个基准上报告了结果,更多跨领域、多任务的泛化性能待核实。
可用于图书/PPT/简报的角度
- 介绍光流在机器人动作表示中的创新用法,对比传统数值动作与视觉动作的不足。
- 展示如何将一个扩散视频生成器同时用于“看”(世界建模)和“动”(策略预测),体现多模态基础模型的统一潜力。
- 可结合无监督预训练趋势,强调光流作为“天然标签”降低数据标注成本的价值。
原始材料
- arXiv: 2607.13017v1
- 项目网站: https://flow-wam.github.io