知识卡片:冲刺全球首个100万小时具身数据,国产三家公司联手共建数据闭环
一句话结论
黎曼动力联合光轮智能、诺亦腾机器人,宣布共建具身智能数据底座,计划到2026年底完成100万小时机器人训练数据采集,力争成为全球首个突破该规模的企业;这一数字约为当前全球高质量具身交互数据存量估算(约50万小时)的两倍。
事件概述
2026年8月,黎曼动力(Riemann Dynamics)与光轮智能、诺亦腾机器人宣布合作,目标是把具身智能领域长期分散的“采集、仿真、训练、评测”环节连接成一条闭环链路。黎曼动力为此设立明确目标:到2026年底完成100万小时机器人训练数据采集。三家公司分工为:黎曼动力负责模型训练,光轮智能负责仿真与评测基础设施,诺亦腾机器人负责动作捕捉与人类动作数据采集。
方法/产品要点
- 黎曼动力:前身为昆仑万维内部的Matrix世界模型团队,于2026年7月正式亮相。已用23.2万小时数据训练出模型Riemann-1.0,官方称其在仿真和真机测试中取得双SOTA。该模型延续了Matrix对世界状态与未来变化的建模能力,并将机器人动作纳入统一框架,支持从“生成看起来合理的未来”迈向“规划可执行的未来”。
- 光轮智能:被称为“全球首个具身数据独角兽”,主打物理AI数据与评测基础设施,自研“求解—测量—生成”三位一体仿真平台,覆盖仿真合成数据、人类行为数据、工业级评测和真实部署反馈。
- 诺亦腾机器人:脱胎于动作捕捉公司诺亦腾,定位为把人类动作经验转化为机器人训练数据,据称在全球动作捕捉市场占有约70%份额。
主要结果或产业意义
- 合作目标是共建开放、标准化的具身数据生态,计划共建数据规范、标注标准和评测基准,并向行业提供标准化数据集、采集方案与评测工具;部分具身训练数据将面向社区开源。
- 对照行业现状:英伟达GR00T 1.7公开披露的真实示教、人类第一视角和仿真数据合计约4万小时;Physical Intelligence训练π0时使用超过1万小时机器人数据;谷歌DeepMind联合全球20多家机构才凑出覆盖22种机器人本体的100多万条轨迹。
- 文章将此次合作类比英伟达联合Google DeepMind、迪士尼及云厂商、机器人公司、数据服务商共建“Physical AI Data Factory”的做法,认为联合建设闭环是机器人行业更现实的选择。
为什么重要
- 具身智能一直难以真正实现Scaling,核心卡点被认为是训练数据的“量”不足和“质”要求提高。机器人训练数据普遍停留在数千到数万小时,达到数十万小时的模型屈指可数。
- 100万小时被视为一次行业实验:验证当数据规模足够大时,机器人能力能否像大模型一样随数据Scaling。文中引用昆仑万维董事长方汉观点:真正的能力分化在于谁能率先把训练数据采集到百万小时、千万小时甚至亿小时级别。
- 与既有相关卡片相比,本条属于AI产业合作动态,增量信息在于:具身智能数据赛道从单点技术比拼转向产业链协同,且首次明确提出100万小时量级目标并配套开源计划。
局限与不确定性
- 100万小时目标目前是公司宣布的计划,实际能否在2026年底完成,待核实。
- 关于“23.2万小时训练出Riemann-1.0并获双SOTA”的具体评测基准、对比对象和第三方验证情况,文中未详细披露,待核实。
- “全球高质量具身交互数据仅约50万小时”引自亿欧智库报告,具体统计口径和发布时间待核实。
- 三家公司合作后的数据规范、标注标准、评测基准以及开源数据的具体范围和时间表,文中未给出细节,待核实。
可用于图书/PPT/简报的角度
- 具身智能的“数据工厂”长什么样:采集—仿真—训练—评测闭环拆解。
- 从自动驾驶到机器人:Waymo“车队出题—仿真练习—路测验证”闭环,为什么机器人不能照搬。
- 百万小时数据意味着什么:对比大模型万亿Token语料,具身数据仍处于早期。
- 国产公司联手挑战“具身Scaling”的行业样本。
原始材料
- 标题:冲刺全球首个100万小时具身数据!国产公司联手了
- 来源:量子位(QbitAI)
- URL:https://www.qbitai.com/2026/08/467486.html
- 发布时间:2026-08-07
- 英文关键词:Embodied AI, Data Scaling, Riemann Dynamics, Noitom Robotics, Lightwheel AI, Robot Training Data, Physical AI