AI消息速览

从计算机使用轨迹归纳任务模型(Task Model Induction)

事件日期 2026-08-20 · 学术前沿 · 已接受

事件日期2026-08-20
信息日期2026-08-20
入库日期2026-08-21
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:从计算机使用轨迹归纳任务模型(Task Model Induction)

英文标题: Inducing Task Models from Computer-Use Traces
英文关键词(据摘要归纳): Task Model Induction; Computer-Use Traces; Hierarchical Objective Model; Procedure Model; Interleaved Task Discovery

一句话结论

TMI 可以在不预先指定任务、不要求单一工作流的条件下,从被动录制的屏幕截图和鼠标/键盘操作轨迹中分离交错任务,并归纳出符号化、可审计、可复用的结构化任务模型,在受控评测中优于既有工作流归纳基线。

事件概述或研究问题

现实中的计算机使用轨迹通常只包含低层事件,如截图、鼠标和键盘操作,而且真实工作往往是多任务交错进行的。论文要解决的问题是:能否自动从这类“无约束轨迹”中归纳出任务模型,而不是依赖预先给定的任务或单一工作流?现有方法通常假设任务已知或流程单一,且只能生成步骤级摘要,难以生成结构化任务模型。

方法/产品要点

  • 提出 Task Model Induction(TMI) 方法。
  • TMI 首先在无约束轨迹中发现潜在任务(latent tasks),从而拆解并发交错的活动。
  • 针对每个潜在任务,TMI 归纳一个任务模型,包含两部分:
    • 层级目标模型:递归式目标分解。
    • 程序模型:刻画组织执行过程的控制流。
  • 输入是自然主义计算机使用轨迹,即被动录制的截图和鼠标/键盘动作。

主要结果或产业意义

  • 内在评测:在受控的人类与智能体轨迹上,TMI 对交错任务的分组与真实分组的一致性达到 0.974
  • TMI 能重构 74.9% 的观测执行步骤,显著高于最强的工作流归纳基线。
  • 外在评测:从 TMI 任务模型中导出的技能,使“留出任务”的准确率比最强基线提升 30.0%
  • 产业意义:计算机使用智能体进入真实工作环境后,需要学习任务实际上是如何完成的;组织也需要审计和复用这些操作知识。TMI 提供了一条从被动轨迹到可审计、可复用任务模型的路径。

为什么重要 / 与既有脉络的关系

既有相关卡片分别关注计算机使用智能体的步骤级 GUI 状态理解(Desktop-Delta Bench)和轨迹奖励模型评估(OSReward)。TMI 的增量价值在于:它不是评测基准或奖励模型,而是面向“任务知识获取”的方法,尝试从无约束、多任务交错的真实使用轨迹中自动提炼结构化任务模型。这补上了智能体从“看得懂界面/判断轨迹好坏”到“复用和审计任务执行方式”之间的关键一环。

局限与不确定性

  • 当前摘要主要报告受控人类与智能体轨迹上的结果,TMI 在真实办公场景中的表现尚不明确,待核实
  • 论文未在摘要中给出具体基线名称、数据集规模、模型架构、消融实验等细节,待核实
  • 任务模型的可解释性、跨用户/跨界面泛化能力、对长尾操作的覆盖情况,均需要进一步查看原文,待核实

可用于图书/PPT/简报的角度

  • “从记录到知识:让计算机使用痕迹变成可审计的任务模型”
  • “智能体进入真实办公:如何从交错操作中学习任务结构”
  • “不是教智能体操作,而是从操作中萃取任务模型”
  • “多任务交错怎么办:TMI 的潜在任务发现与层级目标还原”

原始材料

  • 英文标题:Inducing Task Models from Computer-Use Traces
  • arXiv ID:2608.20319v1
  • 作者:Yucheng Jiang, Zora Zhiruo Wang, Ruishi Chen, Diyi Yang
  • 提交/更新时间:2026-08-20
  • 分类:cs.CL, cs.AI
  • URL:https://arxiv.org/abs/2608.20319v1
  • PDF:https://arxiv.org/pdf/2608.20319v1