AI消息速览

OmegaUse-OfficeVal:具有经济锚定的长时程办公套件任务LLM智能体基准

事件日期 2026-07-29 · 学术前沿 · 已接受

事件日期2026-07-29
信息日期2026-07-29
入库日期2026-07-30
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:OmegaUse-OfficeVal:具有经济锚定的长时程办公套件任务LLM智能体基准

英文标题: OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding
英文关键词: OmegaUse-OfficeVal, LLM agents, benchmark, office-suite, economic grounding, long-horizon

一句话结论

OmegaUse-OfficeVal 基准通过为每项办公套件任务附加人工劳动时间和任务价格代理两种经济信号,允许直接对比人类成本与 LLM 推理成本,评估表明当前前沿 LLM 虽然成本更低、速度更快,但交付质量尚未达到人类水平。

事件概述或研究问题

现有 LLM 智能体基准多聚焦于通用任务或代码/数学领域,缺乏对办公套件(office-suite)长时程工作流的经济可行性评估,即“能否以合理成本完成真实办公任务”。本文提出 OmegaUse-OfficeVal,一个带有任务级经济锚定的基准,包含 100 个源自从业者实际请求并经过隐私保护改造的任务,平均每项需 2.32 小时人工完成。每个任务配有人工劳动时间和任务价格代理,支持价值加权评估和成本-质量比较。

方法/产品要点

  • 任务来源与构造: 来自从业者提出的办公套件请求,经隐私保护流程调整,覆盖文档、表格、演示等常见办公场景。
  • 经济信号: 每项任务提供两个信号——人工劳动时间(human labor time)和任务价格代理(task price proxy),用于量化人类与 LLM 的性价比。
  • 验证机制: 基于细粒度评分标准(fine-grained rubrics)开发代码验证器(code-based verifiers),确保评估稳定可重复。
  • 评估设定: 对比多个前沿 LLM 与人类基线,比较成本、速度与交付质量。

主要结果或产业意义

  • 所有被评估的 LLM 在推理成本和时间上都显著低于人类工人(“substantially cheaper and faster”),但交付质量尚未达到人类可交付的标准(“not yet approached human-level deliverable quality”)。
  • 代码与数据集完全开源(项目网站:https://omegause-officeval.github.io),为后续研究提供标准化平台。
  • 填补了办公套件领域经济可行性评估的空白,为“AI 替代人力”的讨论提供了可量化的比较框架。

为什么重要

与已有基准(如 UniClawBench 关注真实世界主动智能体)不同,OmegaUse-OfficeVal 专门针对办公套件长时程任务,并首次引入任务级经济信号。这一增量信息使得企业和服务商不仅在能力上、也能在成本效益上衡量 LLM agent 的落地价值。同时,它揭示了当前 LLM agent 在“质价比”上的瓶颈:便宜但不够好,为后续优化方向提供了明确信号。

局限与不确定性

  • 当前 LLM agent 未达到人类交付质量,具体任务类型或失误模式未详细说明(待核实)。
  • 基准任务覆盖的办公套件具体软件(如 Microsoft Office、Google Workspace 等)及操作类型(格式调整、公式计算、图表制作等)未在摘要中展开(待核实)。
  • 任务价格代理的设定方法(如是否基于市场薪酬或众包定价)需查阅原文确认(待核实)。

可用于图书/PPT/简报的角度

  • 企业决策参考: “LLM agent 在办公领域能否取代人力?成本低但质量仍需提升——基于 OmegaUse-OfficeVal 的实证。”
  • 技术趋势: “办公自动化新课题:经济锚定下的长时程智能体评估。”
  • 对比分析: “从 UniClawBench 到 OmegaUse-OfficeVal:智能体基准从能力导向走向经济导向。”

原始材料