AI消息速览

世界模型训练完就“退场”,机器人反而更能干了

事件日期 2026-09-05 · 产业观察 · 待审核

事件日期2026-09-05
信息日期2026-09-05
入库日期2026-09-05
通道产业观察
状态待审核
来源量子位

知识卡片:世界模型训练完就“退场”,机器人反而更能干了

英文标题:待核实(原文未提供英文标题)
英文关键词:world model; embodied AI; robot manipulation; imitation learning; VLA; industrial deployment
原始来源:https://www.qbitai.com/2026/09/484611.html

一句话结论

光象科技联合清华大学李升波教授课题组发布的物理原生世界模型 Phi-WM 1.0 ActEffect,在训练阶段用“受控世界模型”检查机器人动作会带来的后果,并把这种检查变成策略优化反馈;训练完成后世界模型退出部署链路,机器人执行任务时不再需要展开未来或搜索候选动作,反而在多个仿真基准上取得了更高成功率。

事件概述或研究问题

该研究对世界模型的用法做了一个“反骨”的设计:以前世界模型像机器人随身携带的“脑内沙盘”,机器人先借助它预测未来,再决定下一步动作;模型想得越多,推理链路越长。ActEffect 则让世界模型只停留在训练场里,专门检查机器人自己提出的动作会造成什么后果。它试图回答具身智能中的长期问题:机器人从演示数据里学会动作后,能否进一步利用“动作后果”反过来改善策略?

方法/产品要点

  • 策略先交出三版完整动作提案:第一版来自前馈分支,像是“第一反应”;第二版是 MIP 动作头给出的粗提案;第三版在粗提案上继续精修,生成最终将被执行的动作。
  • 受控世界模型拿到当前视觉状态和一份动作提案,预测该动作执行后的场景变化;三份动作分别预测,相当于提前看三次结果。
  • 语言指令仍留在 VLA 策略一侧,受控世界模型只看当前画面和动作,不读取任务语言。例如“挪开杯子”和“清理桌面”不会改写推杯子的物理变化。
  • 未来状态被放进冻结的 DINOv3 视觉特征空间,不生成逼真画面,只需抓住物体位置、姿态和场景结构如何变化。
  • 训练数据中有动作执行后的真实观测;受控世界模型将三次预测与真实未来比较,要求精提案比粗提案更接近真实未来,粗提案又要胜过前馈提案。
  • 排序损失加了梯度截断,避免模型通过让差答案变得更差来“衬托”好答案。
  • 部署时,受控世界模型和未来观测分支一并移除,只留下 MIP 动作头完成粗提案和精修,执行阶段保持轻量。

主要结果或产业意义

  • LIBERO 平均成功率为 98.8%,高于 DiT4DiT 的 98.6%。
  • 在包含七类分布偏移的 LIBERO-PLUS 上平均成功率为 80.3%,明显高于 Fast-WAM 的 51.5%。
  • 在 29 维动作空间、双臂/灵巧手/腰部自由度的 RoboCasa-GR1 人形机器人上,平均成功率为 67.5%,比表中第二名 ABot-M0 高 9.2 个百分点,比 Fast-WAM 高 10.8 个百分点。
  • 消融实验:去掉后果反馈后 LIBERO 平均成功率从 98.8% 降到 97.0%;把 DINOv3 特征空间换成 VLM 表示为 97.3%;拿掉排序损失后为 98.1%。
  • 工业意义在于,世界模型执行时不参与推理,可以减少真实部署中的时延、算力和成本;机器人复制到多个工位时,算力成本不会随推理链路一起膨胀。
  • 光象科技已围绕焊接上下料、移动质检等真实场景完成验证:Phi-Bot X1 在 2026 ATC 展会上被放入蔚来汽车焊接上下料场景,机器人连续运行 3 天、累计作业 21.5 小时,零失误、零中断。需注意:该记录来自整套工业具身系统,ActEffect 尚未单独完成真机验证。
  • 光象科技成立于 2025 年 4 月,由清华大学车辆与运载学院和人工智能学院联合孵化;CEO 张涛为清华大学博士、米兰理工大学博士后,此前任阿里巴巴高德地图技术总监;联合创始人李升波长期从事自动驾驶与具身智能研究。

为什么重要

  • 主流做法把世界模型当作机器人执行阶段“随身携带”的预测模块,ActEffect 提供了一种相反的位置安排:世界模型在训练时反复检查动作后果,并把经验写入策略权重,机器人干活时则无需再背着整套世界模型。
  • 这项技术直接回应工业部署最关心的两件事——稳定性和成本,为世界模型进入具身智能提供了“训练时发挥作用、执行时轻量化”的增量思路。
  • 与已有的通用 AI 基础设施、政策框架类卡片不同,本条属于具身智能/世界模型的具体技术发布,并带有明确的汽车工业落地背景。

局限与不确定性

  • 当前成绩全部来自仿真基准(LIBERO、LIBERO-PLUS、RoboCasa-GR1);真机端表现仍需进一步验证。
  • 材料指出,21.5 小时零失误记录来自 Phi-Bot X1 整套工业系统,“下一步才轮到新模型沿着这条真实链路继续接受验证”,因此不能直接推断为 ActEffect 的真机成绩。
  • “复制到更多工位时算力成本不会膨胀”等判断属于商业推论,尚缺规模化部署数据确认。
  • 英文标题原文未提供;部分技术描述来自媒体报道,未经论文或官方技术文档交叉核对,有待核实。

可用于图书/PPT/简报的角度

  • 具身智能中的“训练/执行分离”:世界模型不必一直跟着机器人,把“多想一会儿”留给训练,把短链路留给执行。
  • 用“动作接近不等于结果正确”的例子解释后果监督的必要性,例如夹爪早合上一点可能抓不稳、手腕角度稍偏可能卡住插接。
  • 工业落地叙事:从仿真成功率到产线连续运行、从单个工位到跨工厂复制,说明具身智能的分野最终可能落在商业化能力上。
  • 公司案例:清华孵化团队、汽车产业背景、世界模型与机器人本体同时布局,可作为“高校技术成果向产业转化”的素材。

原始材料

  • 来源:量子位(QbitAI),作者金磊,报道编辑梦瑶,2026-09-05。
  • 标题:这个世界模型训练完就“退场”,机器人反而更能干了
  • URL:https://www.qbitai.com/2026/09/484611.html