知识卡片:RynnValue——基于时间距离的机器人价值基础模型
一句话结论
RynnValue 是一种开放源码的机器人操作价值基础模型(value foundation model),用“时间距离”(temporal distance)替代偏好或进度作为监督信号,仅靠时间戳即可从大规模异构数据中学习奖励相关能力,并在零样本泛化和真实世界策略提升上超越偏好监督方法。
事件概述或研究问题
通用奖励模型正成为扩展机器人学习的瓶颈。现有的奖励/价值模型通常依赖任务内部的锚点,如人类偏好标签或归一化进度,这些信号难以在不同机器人本体和数据源之间干净地迁移。该论文提出,是否可以用一种更通用、可扩展的监督目标来学习价值函数?RynnValue 给出的答案是:时间距离——从当前观测到语言指定目标的“有向代价”(directed cost-to-go),其标签可直接从视频时间戳导出,无需偏好或进度标注。
方法/产品要点
- 核心思想:用时间距离(temporal distance)作为价值监督信号,替代偏好(preference)或归一化进度(normalized progress)。
- 可扩展性:由于时间距离标签可直接从时间戳推导,RynnValue 可扩展到超过 7,000 小时、约 300 万个指令条件片段的数据规模,不依赖偏好或进度标注。
- 训练策略:结合随机时间采样(random temporal sampling)、时间顺序打乱(temporal-order shuffling)和价值隔离注意力(value-isolation attention),抑制模型走捷径,避免预测对失败和倒退不敏感。
- 适配下游策略:通过基于势能的奖励塑形(potential-based shaping)将价值预测转换为稠密奖励,用于策略学习。
主要结果或产业意义
- 在 RBM-EVAL-OOD 基准上,RynnValue 的平均 Kendall's tau_a 达到 0.675,超过完全偏好监督的现有最好方法(0.655),并且是仅用进度监督的对照方案的两倍多(0.292)。
- 具备零样本泛化能力,可泛化到未见过的任务、机器人本体和视角。
- 将价值预测转换为稠密奖励后,在真实世界策略学习中:
- 在线设置下,策略成功率从 52.5% 提升到 72.5%;
- 离线设置下,策略成功率从 63.8% 提升到 82.5%。
- 这些结果说明时间距离既是一种可扩展的监督目标,也是一种实用的通用奖励接口,可能降低机器人基础模型对人工偏好标注的依赖。
为什么重要
现有机器人基础模型的奖励/价值模块往往需要人工偏好标注或任务特定的进度定义,难以跨本体、跨数据源迁移。RynnValue 展示了一个仅依赖时间戳的替代范式,使“价值基础模型”可以从更大规模、更粗粒度的异构数据中学习,并直接服务于通用策略的强化学习。与已有机器人基础模型卡片(如 π0.7 关注策略的涌现组合能力)相比,本条增量信息是:在“奖励/价值模型”这一上游环节,时间距离提供了一种不依赖人工偏好标注的可扩展训练目标。
局限与不确定性
- 论文为 arXiv 预印本(v1),尚未经过同行评审,后续版本可能有修正。
- “开放源码”的范围待核实:模型权重、训练代码、数据集是否全部公开,以论文或项目主页为准。
- RynnValue 的 7,000 小时训练数据具体来源、构成与清洗方式待核实。
- 真实世界实验的任务类型、机器人本体、在线/离线评估协议等细节,需进一步阅读全文确认。
- 时间距离作为监督信号在长期任务、稀疏目标、部分可观测场景中的稳健性仍有待验证。
可用于图书/PPT/简报的角度
- 奖励模型的新范式:从“人工偏好”到“时间戳差”。
- 为什么时间距离能成为机器人价值基础模型的通用“语言”。
- 一张图对比:偏好监督 vs 进度监督 vs 时间距离监督的迁移性。
- 案例:不用偏好标签,RynnValue 如何让真实机器人成功率提升 20 个百分点。
- 展望:价值基础模型是否会像视觉基础模型一样成为机器人学习的通用组件?
原始材料
- 英文标题:RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance
- 英文关键词:Robotic Value Foundation Model, Temporal Distance, Reward Model, Robot Manipulation, Robot Learning
- 作者:Dongchi Huang, Hongyin Zhang, Bohan Hou, Siteng Huang, Zhian Su, Hang Guo, Tong Lu, Zhaofeng Xu, Jiahao Tang, Jianfei Yang, Donglin Wang, Peixi Peng, Mingxiu Chen, Deli Zhao, Xin Li
- arXiv ID:2608.09853v1
- 发布/更新:2026-08-10
- 主要分类:cs.RO(相关:cs.CV, cs.LG)
- URL:https://arxiv.org/abs/2608.09853v1