AI消息速览

看了20万小时「人类干活实录」,机器人悟了——黎曼动力发布Riemann-1.0

事件日期 2026-07-19 · 产业观察 · 已接受

事件日期2026-07-19
信息日期2026-07-19
入库日期2026-07-19
通道产业观察
状态已接受
来源量子位

知识卡片:看了20万小时「人类干活实录」,机器人悟了——黎曼动力发布Riemann-1.0

一句话结论:昆仑万维旗下黎曼动力发布的Riemann-1.0,通过使用20万+小时人类第一视角视频作为训练数据(结合少量机器人数据),在机器人家务基准RoboCasa-365上以62.6%的成功率登顶榜首,验证了“先用海量人类视频预训练物理直觉、再用少量机器人数据对齐动作”的范式在真实机器人上的可行性。

事件概述:2026年7月,昆仑万维子公司黎曼动力在WAIC 2026上正式发布面向通用机器人操作的世界动作模型(World Action Model)Riemann-1.0。该模型在公认最难的家务基准RoboCasa-365上取得62.6%成功率,比此前SOTA高出8.4个百分点;在真机测试中,四项代表性家务任务平均成功率85.00%,过程完成度94.43%,均领先最好的开源模型15个百分点以上。

方法/产品要点

  • 训练数据构成:总计23.2万小时,其中20万+小时人类第一视角视频(“广菜”)、1.2万+小时UMI与外骨骼手套数据(“精菜”)、2万+小时机器人真机与仿真轨迹(“准菜”),覆盖41种机器人本体、数千种交互方式。
  • 关键技术
    • 自研自动化人类数据处理流水线:包括畸变矫正、VLM细粒度切分与标注、六类废片过滤、手部3D重建与轨迹计算、五级分类均衡。
    • 模型架构:基于扩散架构的全因果动作-视频联合建模框架,同时学习视觉动态、环境状态和动作序列;并设计本体专属的动作映射模块以适配不同机器人。
    • 三阶段训练策略:动作损失权重从0.1(人视频预训练,学物理规律)→0.5(引入UMI和机器人数据校准)→0.9(纯机器人数据强化),渐进式从理解世界切换到执行动作。
  • 与其他玩家的区别:Riemann-1.0是“国内较早把‘人视频预训练+机器人数据对齐’范式完整工程化跑通”的模型,仿真和真机均获得验证。

主要结果或产业意义

  • 消融实验:仅用机器人数据成功率为43.4%,加UMI数据为48.2%,再加入人类视频数据后猛增至62.6%(+14.4个百分点),且任务链越长、场景越陌生,人类数据增益越大。在EgoVLA双灵巧手任务中,长程多阶段任务成功率从42.96%提升至71.11%。
  • 仿真成绩:LIBERO 99.0%,RoboTwin 2.0 94.3%,RoboCasa-365 62.6%(SOTA)。
  • 真机成绩:有序积木堆叠、柔性布料折叠、桌面杂物整理、厨房餐具收纳四类任务平均成功率85.00%,过程完成度94.43%,每项成功率均超80%。
  • 产业意义:标志着“从开放世界人类视频学习物理常识,再对齐机器人动作”的范式在工业级产品中得到验证,为降低机器人训练对昂贵机器人数据的依赖提供了可行路径;同时,昆仑万维通过子公司黎曼动力首次将AI能力从数字世界延伸至物理世界。

为什么重要

  • 本文是对“机器人基础模型路线之争”(VLA vs 世界模型)走向合流的最新实证,英伟达等机构的综述已指出下一代机器人基础模型大概率是两者的混合体。
  • 与已有相关卡片(AlphaEvolve/AlphaEarth Foundations)不同,本文聚焦具身智能领域的数据训练新范式,填补了此前在机器人训练数据来源与工程化落地方面的空白。
  • 展示了内容/AI公司跨界进入机器人领域的逻辑:世界模型作为底座,一头连接游戏/视频,另一头连接实体机器人。

局限与不确定性

  • 人类视频中隐式的动作标签是通过自研流水线(手部3D重建等)提取的,该方法的通用性和精度是否独立于特定场景尚待更多验证。
  • 真机测试仅覆盖四类家务场景,在更复杂、更非结构化的真实家庭环境中的泛化能力待核实。
  • 模型训练所需算力和工程成本未公开;与同类模型的公平对比仅限于开源基座,与商业闭源模型的差距未知。
  • 从“仿真登顶”到“真机上岗”的岗前实训属于针对性后训练,对于未见过的任务或机器人本体是否依然有效待核实。

可用于图书/PPT/简报的角度

  • 【训练数据创新】为什么“看人干活”比“看机器人干活”更有效?人类视频的规模与语义丰富度如何克服动作标签缺失的难题。
  • 【范式演进图】VLA→世界模型→混合模型(WAM)的技术路线图,以及各阶段的典型代表(如Being-H0.7、GEN-1、Riemann-1.0)。
  • 【产业跨界案例】昆仑万维从AI游戏/音乐/短剧切入机器人领域的战略逻辑:数字世界生成能力向物理世界闭环的延伸。

原始材料

  • 标题:看了20万小时「人类干活实录」,机器人悟了
  • 英文标题:待补充(来源页面未提供英文标题)
  • 英文关键词:Riemann-1.0, World Action Model, human video pretraining, embodied AI, robot manipulation
  • 来源:量子位,2026-07-19,URL: https://www.qbitai.com/2026/07/454592.html