AI消息速览

重新思考本地计算机使用智能体的推理时扩展:失败模式与计算权衡

事件日期 2026-07-30 · 学术前沿 · 已接受

事件日期2026-07-30
信息日期2026-07-30
入库日期2026-08-01
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:重新思考本地计算机使用智能体的推理时扩展:失败模式与计算权衡

英文标题: Rethinking Inference-Time Scaling in Local Computer-Use Agents: Failure Modes and Compute Tradeoffs

英文关键词: computer-use agents; inference-time scaling; local models; failure modes; compute tradeoffs; OSWorld

一句话结论

在本地计算机使用智能体(CUA)上增加推理时计算往往收益递减,并会改变失败模式;上下文扩展可提升轨迹稳定性但会饱和,时间扩展减少停滞却未必提升任务成功率,结构分解带来规划/格式开销,并行扩展以高计算成本部分缓解失败。

研究问题

在严格硬件约束下,推理时扩展(inference-time scaling)对本地计算机使用智能体是否有效?其失败模式和计算权衡如何?既有研究多聚焦于前沿模型,资源受限的本地模型尚缺乏系统理解。

方法/产品要点

  • 对本地 CUA 的推理时扩展进行系统实证研究,覆盖四个维度:上下文(contextual)、时间(temporal)、结构(structural)、并行(parallel)。
  • 评估模型:Qwen3-VL-8B / 30B-A3B、UI-TARS-1.5-7B、OpenCUA-7B。
  • 评估基准:OSWorld。

主要结果

  • 额外计算常常产生递减收益,同时改变失败模式。
  • 上下文扩展提供历史依据,改善轨迹稳定性和任务准确率;但随 token 成本增加收益饱和,失败模式从重复/停滞轨迹转向过早的虚假成功。
  • 时间扩展能减少最大步数停滞,但并未显著提升任务成功率;更长地平线往往延长错误轨迹而非纠正错误。
  • 结构分解会在本地两阶段智能体中引入规划和格式开销。
  • 并行扩展可部分缓解上述失败,但计算成本很高。

产业意义

高效本地 CUA 需要选择性计算分配、失败感知控制机制,以及围绕本地模型能力与局限设计的智能体框架,而非简单地增加推理时计算。

为什么重要

这是对推理时扩展在本地、资源受限模型上的系统实证研究。此前研究主要表明推理时扩展可改进前沿计算机使用智能体,但对本地模型效果未知。本卡片的增量信息在于:揭示了本地场景下“更多计算”并非线性收益,失败模式会随扩展维度发生转移;对设计高效本地智能体有直接指导意义。

局限与不确定性

  • 摘要未提供各维度增益的具体量化数值、模型间差异细节、计算成本具体数值及统计显著性,这些内容均待核实。
  • 作者、发布时间、arXiv 编号等来自 arXiv 元数据,未经全文验证。
  • 由于无法获取完整论文,实验设置、超参数、评测细节待核实。

可用于图书/PPT/简报的角度

  • 用“本地AI智能体:砸更多算力并非万能”切入,说明推理时扩展的边际收益递减。
  • 对比前沿模型与本地模型的差异:前沿模型受益于推理时扩展,而本地模型可能出现“延长错误轨迹”等现象。
  • 提出设计原则:选择性计算分配、失败感知控制,而非盲目增加推理计算。

原始材料

  • 标题:Rethinking Inference-Time Scaling in Local Computer-Use Agents: Failure Modes and Compute Tradeoffs
  • arXiv ID:2607.28573v1
  • 作者:Woongkyu Lee, Jungwook Choi
  • 发布/更新:2026-07-30
  • 类别:cs.AI
  • URL:https://arxiv.org/abs/2607.28573v1
  • PDF:https://arxiv.org/pdf/2607.28573v1