知识卡片:Deform360:用于可变形世界模型的大规模多视图视觉触觉数据集
一句话结论
Deform360 是目前最大的真实世界可变形物体交互数据集,包含 198 个日常物体、1980 个交互序列和超过 215 小时的观测数据,用于系统评估 2D 像素空间与 3D 几何空间两种世界模型范式的优劣,并为可变形物体机器人规划提供基准。
事件概述或研究问题
预测物体动力学(即世界建模)是机器人操作的基本挑战,而可变形物体因其高维状态空间和复杂材料特性尤其困难。现有世界模型分为两种范式:在 2D 像素空间学习动力学,或在更显式的 3D 几何空间学习。但由于缺乏多样、大规模的真实世界数据,对两者相对优势和局限性的系统理解仍然缺乏。为此,研究者构建了 Deform360 数据集。
方法/产品要点
- 数据集包含 198 个日常物体、1980 个交互序列,总观测时长超过 215 小时。
- 使用 41 个环绕相机和双手触觉夹爪同时捕捉全局运动和接触引起的局部变形。
- 利用新颖的无标记视觉触觉 3D 追踪流水线提取密集几何与运动信息。
- 系统评估了当前最先进的世界模型,包括 2D 视频模型与 3D 粒子模型的对比。
主要结果或产业意义
- 初步演示表明该数据集可用于可变形物体的机器人规划任务,验证了真实世界应用可行性。
- 分析揭示了结构先验与可扩展性之间的权衡,为未来可推广的可变形物体中心世界建模研究提供了可靠基准。
为什么重要
可变形物体操作是机器人领域尚未解决的难题,Deform360 填补了大规模真实世界数据集的空白,首次允许对 2D 和 3D 世界模型进行公平、系统的比较,有望推动机器人对柔软、易变形物体的感知与操控能力。
局限与不确定性
- 数据集目前仅包含 198 个日常物体,可能未覆盖所有可变形材料类型(如液体、颗粒物等)。
- 文中提到的是“初步演示”(preliminary demonstration),尚未提供详细的规划成功率等定量指标,具体性能需要进一步验证。
- 无标记追踪流水线的精度和泛化性对具体场景的依赖程度待核实。
可用于图书/PPT/简报的角度
- 机器人物体操控数据集发展里程碑:从刚性物体到可变形物体的数据需求变化。
- 2D vs 3D 世界模型的范式之争:数据驱动的实证研究如何提供证据。
- 视觉与触觉融合在机器人学习中的作用:多模态数据捕获技术。
原始材料
- 论文标题:Deform360: A Massive Multi-view Visuotactile Dataset for Deformable World Models
- 英文关键词:deformable objects, world modeling, visuotactile dataset, robot manipulation
- arXiv ID:2607.05390v1
- 项目网站:https://deform360.lhy.xyz
- 作者:Hongyu Li, Wanjia Fu, Xiaoyan Cong, Zekun Li, Binghao Huang, Hanxiao Jiang, Xintong He, Yiqing Liang, Rao Fu, Tao Lu, Srinath Sridhar, Kevin A. Smith, George Konidaris, Yunzhu Li
- 发布/更新日期:2026-07-06T17:59:18Z
- 源摘要:https://arxiv.org/abs/2607.05390v1