知识卡片:ORCA-bench:语言模型智能体为 Oncall 根因分析做好准备了吗?
英文标题:ORCA-bench: How Ready Are Language Model Agents for Oncall? 英文关键词:ORCA-bench; LLM Agents; Oncall; Root Cause Analysis; Benchmark; SRE; Telemetry
一句话结论
在接近生产环境的 oncall 根因分析(RCA)评测中,五个前沿智能体的最佳准确率在 Medium(真实输入设定)上只有 25.3%,在 Hard 上只有 10.0%;最弱模型会在 40% 的故障报告中提出不合理的幻觉根因。即使 Claude Fable 5 也无法弥合这一差距,说明通用编码智能体距离安全承担生产可靠性值班仍有明显距离。
事件概述/研究问题
大语言模型已经能写代码、打补丁、搜索代码,但 oncall 根因分析要求的是另一种能力:从模糊的用户报告出发,在嘈杂的指标、日志、追踪(traces)和源码中进行推理,并且常常要在故障发生数小时后才开始。ORCA-bench 正是为此设计:把通用编码智能体放进生产保真的 oncall 场景,系统测量它们能否完成根因分析。
方法/产品要点
- 采用一个 live OpenTelemetry 插桩的微服务系统,暴露六天的指标、日志和追踪,通过真实遥测接口(Prometheus、Jaeger、经 Grafana 访问的 OpenSearch)提供访问,并开放完整源码。
- 构建了 1,079 个 RCA 任务,系统变化报告具体程度(report specificity)、故障发现延迟(time-to-detection)和共现故障场景。
- 真实故障症状(ground-truth symptoms)由专家 SRE 整理并审定。
- 使用 LLM-as-judge 评分,并由人类独立复评,加权 Cohen's κ = 0.90。
- 评测五个前沿智能体,区分 Medium(现实输入设定)和 Hard;还测试了移除源码访问的影响。
主要结果或产业意义
- 最佳 RCA Accuracy:Medium 25.3%,Hard 10.0%。
- 即使使用 Claude Fable 5,该准确率差距仍然存在。
- 最弱模型在 40% 的故障报告中幻觉出不可能的根因。
- 移除源码访问后,所有评测指标都下降。
- 上述结果来自一个 curated 的 50 GB / 六天测试环境,任务被隔离调查,系统代码和插桩公开。真实生产系统通常比它大数个数量级、更动态、更独特(idiosyncratic),因此这个性能差距只能视为所需工程投入的“下界”。
- 基准数据已公开:https://hub.harborframework.com/datasets/orca-bench/ORCA-bench
为什么重要
ORCA-bench 提供了一个可复现的评测框架,把智能体能力评估从“代码生成/补全”扩展到“生产故障排查”。它对产业界的直接启示是:前沿编码智能体虽然能处理代码任务,但在真实感的 oncall 根因分析中仍然脆弱;这个下界结果提醒我们,在可靠性要求极高的生产环境里,不能仅凭代码能力就信任智能体。
与既有脉络的关系
与已有相关卡片(BiSCo-LLM 压缩、预算感知测试时模型选择、选择性状态空间推理适配)关注模型效率或推理方法不同,本条是一个评测基准,面向“智能体能否承担 oncall/生产可靠性”这一新的能力维度。它不是对某个模型方法的改进,而是对前沿智能体 RCA 能力的公共测量,因此不与前述卡片重复。
局限与不确定性
基于当前可得材料(摘要),以下信息待核实:
- 五个前沿智能体的具体名称、版本和配置未在摘要中完整列出(摘要仅点名 Claude Fable 5)。
- Medium / Hard 的具体难度划分标准,以及 RCA Accuracy 是否要求根因定位到某个特定粒度,待核实。
- LLM-as-judge 的提示词、人工复评流程和加权 Cohen's κ 的详细计算方法,待核实。
- “40% 幻觉”是指最弱模型在所有任务中还是某一子集中的比例,摘要未细化。
- 除“移除源码访问”这一消融外,其他消融实验和与既有基准的定量对比,摘要未提供。
可用于图书/PPT/简报的角度
- “从写代码到值班”:为什么 oncall 根因分析比代码生成更难。
- 25.3% / 10.0%:前沿智能体在真实感故障排查中的准确率。
- 40% 的幻觉根因:AI 值班的风险图景。
- 生产保真基准三要素:真实遥测接口、专家 SRE 审定、人类复评(κ = 0.90)。
- 公开代码、公开数据、可复现“下界”:ORCA-bench 的评测价值。
原始材料
- 英文标题:ORCA-bench: How Ready Are Language Model Agents for Oncall?
- arXiv ID:2607.28545v1
- 作者:Albert Gong, Kyuseong Choi, Abhineet Agarwal, Jason Schechner, Ryan Huang, Raj Agrawal, Anish Agarwal, Raaz Dwivedi
- 发布时间:2026-07-30
- 分类:Primary cs.CL; Categories cs.CL, cs.AI, cs.SE
- 摘要页面:https://arxiv.org/abs/2607.28545v1
- PDF:https://arxiv.org/pdf/2607.28545v1
- 数据公开页面:https://hub.harborframework.com/datasets/orca-bench/ORCA-bench