AI消息速览

ORCA-bench:语言模型智能体为 Oncall 根因分析做好准备了吗?

事件日期 2026-07-30 · 学术前沿 · 已接受

事件日期2026-07-30
信息日期2026-07-30
入库日期2026-08-01
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:ORCA-bench:语言模型智能体为 Oncall 根因分析做好准备了吗?

英文标题:ORCA-bench: How Ready Are Language Model Agents for Oncall? 英文关键词:ORCA-bench; LLM Agents; Oncall; Root Cause Analysis; Benchmark; SRE; Telemetry

一句话结论

在接近生产环境的 oncall 根因分析(RCA)评测中,五个前沿智能体的最佳准确率在 Medium(真实输入设定)上只有 25.3%,在 Hard 上只有 10.0%;最弱模型会在 40% 的故障报告中提出不合理的幻觉根因。即使 Claude Fable 5 也无法弥合这一差距,说明通用编码智能体距离安全承担生产可靠性值班仍有明显距离。

事件概述/研究问题

大语言模型已经能写代码、打补丁、搜索代码,但 oncall 根因分析要求的是另一种能力:从模糊的用户报告出发,在嘈杂的指标、日志、追踪(traces)和源码中进行推理,并且常常要在故障发生数小时后才开始。ORCA-bench 正是为此设计:把通用编码智能体放进生产保真的 oncall 场景,系统测量它们能否完成根因分析。

方法/产品要点

  • 采用一个 live OpenTelemetry 插桩的微服务系统,暴露六天的指标、日志和追踪,通过真实遥测接口(Prometheus、Jaeger、经 Grafana 访问的 OpenSearch)提供访问,并开放完整源码。
  • 构建了 1,079 个 RCA 任务,系统变化报告具体程度(report specificity)、故障发现延迟(time-to-detection)和共现故障场景。
  • 真实故障症状(ground-truth symptoms)由专家 SRE 整理并审定。
  • 使用 LLM-as-judge 评分,并由人类独立复评,加权 Cohen's κ = 0.90。
  • 评测五个前沿智能体,区分 Medium(现实输入设定)和 Hard;还测试了移除源码访问的影响。

主要结果或产业意义

  • 最佳 RCA Accuracy:Medium 25.3%,Hard 10.0%。
  • 即使使用 Claude Fable 5,该准确率差距仍然存在。
  • 最弱模型在 40% 的故障报告中幻觉出不可能的根因。
  • 移除源码访问后,所有评测指标都下降。
  • 上述结果来自一个 curated 的 50 GB / 六天测试环境,任务被隔离调查,系统代码和插桩公开。真实生产系统通常比它大数个数量级、更动态、更独特(idiosyncratic),因此这个性能差距只能视为所需工程投入的“下界”。
  • 基准数据已公开:https://hub.harborframework.com/datasets/orca-bench/ORCA-bench

为什么重要

ORCA-bench 提供了一个可复现的评测框架,把智能体能力评估从“代码生成/补全”扩展到“生产故障排查”。它对产业界的直接启示是:前沿编码智能体虽然能处理代码任务,但在真实感的 oncall 根因分析中仍然脆弱;这个下界结果提醒我们,在可靠性要求极高的生产环境里,不能仅凭代码能力就信任智能体。

与既有脉络的关系

与已有相关卡片(BiSCo-LLM 压缩、预算感知测试时模型选择、选择性状态空间推理适配)关注模型效率或推理方法不同,本条是一个评测基准,面向“智能体能否承担 oncall/生产可靠性”这一新的能力维度。它不是对某个模型方法的改进,而是对前沿智能体 RCA 能力的公共测量,因此不与前述卡片重复。

局限与不确定性

基于当前可得材料(摘要),以下信息待核实:

  • 五个前沿智能体的具体名称、版本和配置未在摘要中完整列出(摘要仅点名 Claude Fable 5)。
  • Medium / Hard 的具体难度划分标准,以及 RCA Accuracy 是否要求根因定位到某个特定粒度,待核实。
  • LLM-as-judge 的提示词、人工复评流程和加权 Cohen's κ 的详细计算方法,待核实。
  • “40% 幻觉”是指最弱模型在所有任务中还是某一子集中的比例,摘要未细化。
  • 除“移除源码访问”这一消融外,其他消融实验和与既有基准的定量对比,摘要未提供。

可用于图书/PPT/简报的角度

  • “从写代码到值班”:为什么 oncall 根因分析比代码生成更难。
  • 25.3% / 10.0%:前沿智能体在真实感故障排查中的准确率。
  • 40% 的幻觉根因:AI 值班的风险图景。
  • 生产保真基准三要素:真实遥测接口、专家 SRE 审定、人类复评(κ = 0.90)。
  • 公开代码、公开数据、可复现“下界”:ORCA-bench 的评测价值。

原始材料

  • 英文标题:ORCA-bench: How Ready Are Language Model Agents for Oncall?
  • arXiv ID:2607.28545v1
  • 作者:Albert Gong, Kyuseong Choi, Abhineet Agarwal, Jason Schechner, Ryan Huang, Raj Agrawal, Anish Agarwal, Raaz Dwivedi
  • 发布时间:2026-07-30
  • 分类:Primary cs.CL; Categories cs.CL, cs.AI, cs.SE
  • 摘要页面:https://arxiv.org/abs/2607.28545v1
  • PDF:https://arxiv.org/pdf/2607.28545v1
  • 数据公开页面:https://hub.harborframework.com/datasets/orca-bench/ORCA-bench