AI消息速览

OSReward:建立跨平台计算机使用奖励模型的标准化评估

事件日期 2026-07-30 · 学术前沿 · 已接受

事件日期2026-07-30
信息日期2026-07-30
入库日期2026-07-31
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:OSReward:建立跨平台计算机使用奖励模型的标准化评估

英文标题:OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models
英文关键词:Computer-Using Agents (CUAs); Trajectory Verification; VLM Judges; Reward Models; Benchmark; OS-Shepherd

一句话结论

OSReward 是一个用于评估视觉语言模型(VLM)作为“计算机使用智能体(CUA)轨迹判断器”是否可靠的基准。作者发现,即便是最先进的 VLM 判断器也存在系统性“宽松偏差”,容易把失败轨迹误判为成功;为此,作者构建了开放推理标注语料 OS-Shepherd-100K,并训练出低成本、可靠的开放奖励模型 OS-Shepherd(9B/35B),在成本比前沿模型低 30–60% 的情况下匹配商业判断模型。

事件概述/研究问题

计算机使用智能体(CUA)在跨平台数字任务中快速进步。判断一个 CUA 轨迹是否完成指令,是 CUA 评估、数据筛选和强化学习的核心。人工编写的验证器和人工标注都难以规模化,因此领域越来越依赖 VLM 作为轨迹判断器。然而,这些 VLM 判断器本身是否足够可靠,一直缺乏系统研究。OSReward 正是针对这一问题提出的标准化评估基准。

方法/产品要点

  • OSReward 基准:轨迹来自多种智能体骨架(agent backbones)执行经过人工验证的指令,覆盖多个平台;通过多阶段人工标注获得 ground-truth 判定标签。
  • OSReward-Hard:在 OSReward 基础上构造的困难子集,集中真正难判断的案例。
  • OSReward-Multi:面向细粒度效率打分和对齐打分的扩展。
  • OS-Shepherd-100K:开放的、带推理标注的轨迹判断语料,供社区使用。
  • OS-Shepherd(9B 和 35B):在该语料上训练得到的开放奖励模型,提供低成本、稳定、可靠的奖励信号。

主要结果/产业意义

  • 对 VLM 判断器的最全面评估(作者称)显示:即使最先进模型也达不到“理想判断器”水平,普遍存在系统性宽松偏差,会把失败运行误判为成功。
  • 少数足够可靠的模型过于昂贵,难以大规模运行;而价格可负担的开放模型又远远落后。
  • OS-Shepherd 以比前沿模型低 30–60% 的成本匹配商业判断模型,为大规模 CUA 训练提供了可行的奖励信号来源。
  • 代码、基准、数据集与模型权重已公开(见原始材料)。

为什么重要

在 CUA 领域,奖励信号的质量直接影响强化学习与数据筛选。此前缺少一个专门评估“VLM 判断器”的标准基准。OSReward 填补了这一缺口,并揭示了现有判断器的系统性偏差,同时提供了开源奖励模型作为低成本替代方案。与已有卡片中的 Desktop-Delta Bench(聚焦步骤级 GUI 状态转换因果理解)相比,OSReward 的增量在于:它从完整轨迹层面评估奖励模型/判断器的可靠性,并附带可训练的开源奖励模型与语料。

局限与不确定性

  • 本卡片仅基于 arXiv 摘要,OSReward 的具体任务规模、平台列表、轨迹数量、人工标注协议、评测指标等细节待核实
  • “最全面评估”是作者表述,需结合论文全文核对。
  • 基准是否覆盖所有主流 CUA 框架、OS-Shepherd 在不同平台上的泛化能力、以及成本比较的具体计算口径,均待核实

可用于图书/PPT/简报的角度

  • 主题:“谁来评判 AI 智能体?”——用 OSReward 说明奖励模型本身也需要被评估和监督。
  • 论点示例:大模型作为评判者存在“宽松偏差”,会影响智能体训练效果;开放小模型可在低成本下逼近商业模型。
  • 数据点:30–60% 的成本下降、9B/35B 参数、100K 条推理标注语料。

原始材料

  • 英文标题:OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models
  • arXiv ID:2607.28609v1
  • URL:https://arxiv.org/abs/2607.28609v1
  • PDF:https://arxiv.org/pdf/2607.28609v1
  • 作者:Qiushi Sun, Kanzhi Cheng, Yian Wang, Bowen Yang, Hang Yan, Liheng Chen, Fangzhi Xu, Zichen Ding, Nuo Chen, Jialin Cao, Xingdong Gong, Zehao Li, Kaiming Jin, Xinfeng Yuan, Zhoumianze Liu, Jingyang Gong, Zhangyue Yin, Jiahui Gao, Zhiyong Wu, Tianbao Xie, Jianbing Zhang, Ben Kao, Lingpeng Kong
  • 发布/更新时间:2026-07-30
  • 分类:cs.AI, cs.CL, cs.CV