知识卡片:自变量发布世界模型WALL-SS,可连续虚拟推演60秒
英文标题:待核实(原始页面无英文标题;中文标题为“腾讯研究院AI速递 20260828”) 英文关键词:world model; WALL-SS; next-scale autoregressive; action-conditioned generation; embodied AI; robot learning; long-term memory; virtual rollout
一句话结论
WALL-SS 是自变量机器人发布的“下一尺度自回归世界模型”,核心改进是让未来画面生成受动作控制,配合长时记忆可连续虚拟推演约 60 秒;在动作跟随得分与虚实相关性上明显优于材料中的对比模型,但暂不支持力矩与多指灵巧手。
事件概述或研究问题
按腾讯研究院AI速递 2026-08-28 报道,自变量机器人发布了世界模型 WALL-SS。该模型面向机器人操作与虚拟推演场景,试图解决世界模型中的“动作可控性”问题:模型不仅要生成未来画面,还要让不同动作对应不同结果,才能在虚拟环境中为真机策略提供可靠预测。
方法/产品要点
- 模型定位:下一尺度自回归世界模型(Next-Scale Autoregressive World Model),由粗到细描绘未来画面。
- 动作可控性:让不同动作对应不同结果,缓解所谓“磁铁式抓取”(材料未展开定义,待核实)。
- 长时记忆:配合长时记忆可连续推演约 60 秒;材料称多数模型极限为 20 至 30 秒。
- 对比表现:动作跟随得分 WALL-SS 达 0.29,Cosmos3-Nano 为 0.044,其余对比模型为 0。
- 虚实评估:600 组虚实配对实验中,虚拟与真机成功率相关系数达 0.926,策略排序准确率 89%。
- 当前局限:暂不支持力矩与多指灵巧手。
主要结果或产业意义
WALL-SS 的动作跟随得分显著高于 Cosmos3-Nano,且“其余模型为 0”,说明许多现有世界模型可能并未真正把动作输入与生成结果绑定。虚拟与真机成功率相关系数 0.926 则意味着,虚拟推演在策略排序和筛选方面有较强的参考价值,可用于降低真机试错成本。
从产业角度看,这条动态显示具身智能竞争正在从“生成更像视频的世界模型”转向“可控、可交互、可用于机器人策略评估的世界模型”。
为什么重要
世界模型被认为是机器人基础模型的重要方向。WALL-SS 的增量信息在于:
- 强调“动作可控性”,并给出了可量化的动作跟随得分;
- 通过长时记忆把连续虚拟推演时长推到约 60 秒;
- 提供虚实相关性数据,展示世界模型用于真机策略排序的潜力。
这表明机器人领域的世界模型不仅要比“画面对不对”,还要比“动作控不控得住”“推演长不长”“虚实像不像”。
与既有脉络的关系
已有相关卡片分别涉及 NIST AI 风险管理框架、Epoch AI 研究趋势、OpenRouter 模型基础设施,均未覆盖具身智能/世界模型。本条作为 AI 产业动态中的机器人基础模型发布,增量在于:WALL-SS 以动作跟随得分、60 秒连续推演和 0.926 虚实相关性,补充了“世界模型如何用于机器人验证”的具体案例。
局限与不确定性
- 原始材料为媒体速递,并非技术报告或论文,WALL-SS 的完整技术细节、参数量、训练数据和推理成本均待核实。
- “动作跟随得分”的计算方式未在材料中说明。
- “磁铁式抓取”的具体定义未在材料中展开。
- 对比模型的具体设置、版本和评估任务未逐一列出。
- “其余模型为 0”的具体模型名单未给出。
- 600 组虚实配对实验的任务类型、机械臂平台和评估指标未详细说明。
- 暂不支持力矩与多指灵巧手,因此对力控和精细操作任务的适用性有限。
- WALL-SS 是否为官方英文全称缩写、是否有技术报告或开源计划,待核实。
可用于图书/PPT/简报的角度
- 用“动作跟随得分”对比说明:不是所有世界模型都能让动作影响预测结果。
- 用“60 秒 vs 20—30 秒”说明长时记忆对世界模型持续推演的价值。
- 用“虚实成功率相关系数 0.926”解释 sim-to-real 的量化评估思路。
- 用“磁铁式抓取”作为案例,讨论视频生成模型在机器人任务中的物理一致性问题。
- 作为“腾讯研究院AI速递”中的一条产业动态,体现 2026 年具身智能基础模型的竞争焦点。
原始材料
- 来源:腾讯研究院AI速递 20260828(搜狐号)
- URL:https://m.sohu.com/a/1068548964_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=5
- 相关内容原始表述:自变量发布世界模型WALL-SS,可连续虚拟推演60秒