知识卡片:用世界模型给VLA当教练——原力灵机发布DW0.5
一句话结论
原力灵机发布具身世界模型DW0.5,将其作为VLA后训练的“虚拟环境”,通过三大专家模块实现强化学习的低成本闭环,使真机数据需求降低60%、训练成本降低40%。
事件概述
2026年7月,原力灵机发布首款具身世界模型DW0.5,并将其接入世界模型驱动的具身智能后训练框架DFOL 2.0。该模型用上万小时真机、多视角数据完成联合预训练,能高保真模拟成功与失败轨迹,支撑VLA模型的在线强化学习训练,解决具身智能后训练中缺乏低成本反馈闭环的行业难题。
方法/产品要点
- DW0.5架构:由Video Expert、Action Expert、Value Expert三大模块组成能力链路。
- Action Expert:将动作信息作为结构性强先验,通过MoT注意力与视频序列帧级对齐,确保动作与预测画面的物理一致性。
- Video Expert:能模拟成功与失败两类视觉轨迹(失败轨迹对后训练价值高),数据源包括具身公开数据、自采机器人数据、互联网视频、第一视角人类活动数据、真机与仿真rollout数据。
- Value Expert:将未来状态转化为可训练的价值信号(成功概率/任务价值评估),Value-Order Correlation达95%以上,用于候选动作筛选、RL奖励信号、部署时在线监测。
- 后训练框架DFOL 2.0:基座模型DM0.5生成初始动作→DW0.5在虚拟环境预演轨迹→CFG-RL教练打分→奖励回传更新权重。循环中大部分数据由DW0.5在线生成,降低真机依赖。
主要结果或产业意义
- 数据效率:后训练中真机数据需求骤降60%,整体训练成本下降40%。
- 任务表现:接入DFOL 2.0后,在打气球(关键步骤成功率从10%→90%/100%)、晾衣服(挂上衣架50%→100%)、叠纸盒等复杂任务上成功率显著提升。
- 基准成绩:在EWMBench(4.73分)、WorldArena(73.54分)等评测中斩获SOTA(数据截至2026年7月9日)。
- 部署进展:已在内部跑通闭环流程,并接入DexDev MaaS平台,支持特定场景后训练补足。
为什么重要
具身智能长期面临后训练飞轮难以闭环的困境——真机试错成本高、人工反馈难以高频覆盖、传统仿真与现实差距大。DW0.5提供了一种介于真机与仿真之间的“学习型环境”,让VLA能在虚拟世界中低成本高频探索、获得密集反馈,是“世界模型在具身智能中规模化落地”的重要一步。相比已有相关卡片(如AlphaEvolve、AlphaEarth),本卡片聚焦具身智能领域的世界模型应用与RL后训练方法论,填补了“用生成式环境降低真机数据依赖”的具体实践描述。
局限与不确定性
- 原力灵机强调“真机数据仍很重要,世界模型需真机校准”,因此该方法不能完全替代真实环境。
- 实际部署中,跨任务、跨构型、跨环境的零样本泛化能力仍有待观察,文中仅给出实验室场景的成功率提升。
- 成本降低40%的具体核算口径(是否包含真机校准成本)未详细说明。
- 模型开源信息:GitHub(https://github.com/dexmal/opendw)和Hugging Face(https://huggingface.co/Dexmal/DW05-Base)已提供,但具体社区使用反馈待核实。
可用于图书/PPT/简报的角度
- 技术路径:展示“世界模型作为RL环境”这一新范式,对比“代码Agent自闭环”与“具身智能后训练困境”。
- 产业降本:以真机数据需求降低60%为例,说明世界模型在具身智能商业化中的成本压缩潜力。
- 架构创新:分解三大专家模块的设计思路(强先验动作、失败模拟、价值转化),可作AI系统设计案例。
- 对比视角:与“纯真机试错”“传统物理仿真”进行成本-效果比较。
原始材料
- 来源:量子位(QbitAI),2026-07-16,标题《用世界模型给VLA当教练,原力灵机发布DW0.5,把RL搬进虚拟世界》
- 英文关键词:VLA, World Model, Embodied AI, 原力灵机 (Primitive Force)
- 英文标题:World Model as VLA Coach: Primitive Force Releases DW0.5, Bringing RL into Virtual World