知识卡片:超越成功率:成本感知的攻防安全智能体评估
英文标题: Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents
英文关键词: Security Agent Evaluation, Cost-Aware, Offensive Security, Defensive Security, Foundation Model, Large Language Model
一句话结论
基于语言模型的安全智能体在进攻性(红队)任务中的成功率随推理预算增加而提升,但防御性(蓝队)SOC调查任务的性能更多取决于工具使用与遥测导航能力,而非推理预算本身;评估标准应加入经济效率和操作适配性。
研究问题
当前安全智能体的评测几乎只关注峰值进攻能力(漏洞发现、利用开发、渗透测试、CTF解题),但实际运营安全中,每步推理、工具调用、遥测查询和富集请求都会消耗预算。本文提出成本-成功率联合视角,重新评估语言模型安全智能体的真实可用性。
方法/产品要点
- 评估场景:进攻性 Cybench 挑战(CTF类)与防御性 Splunk BOTS v1 调查挑战(SOC场景)。
- 评估方式:不再仅报告最佳成功率,而是在固定成本水平下比较模型,并将性能分解为推理开销和工具开销两部分。
- 交互式展示:结果发布在 https://evals.frontier.security。
主要结果
- 红队(进攻):CTF类任务性能随测试时计算增加而改善;可扩展的开放权重模型在保持成本竞争力前提下可接近前沿专有系统。
- 蓝队(防御):SOC调查的成功率并不以相同方式随推理预算扩展——更依赖规范的工具使用、遥测导航和选择性富集,而非原始推理预算。
- 主张:安全智能体基准应同时衡量任务成功率、经济效率和操作适配性;原生SOC成本感知评估更能反映实际可用性与改进方向。
为什么重要
- 揭示了当前安全智能体评估的盲点:峰值成功率可能高估模型在有限预算下的实用价值。
- 量化了红蓝队不同的扩展规律,为部署决策(例如选择开放权重模型还是专有系统)提供成本维度的参考。
- 为防御型智能体指出了瓶颈不在推理能力,而在工具使用与任务结构化,推动后续研究聚焦于“如何让模型更高效地利用有限API调用和查询预算”。
局限与不确定性
- 防御场景仅使用了Splunk BOTS v1单一数据集,结论的泛化性待验证。
- 成本模型(推理费、工具调用费)的具体定价基准未在摘要中明确,可能需要查阅完整论文确认。
- 开放权重模型与专有系统的“成本竞争力”比较依赖于具体部署场景与定价策略。
- 待核实:具体使用的模型清单(如哪些开放权重模型、哪些前沿专有系统)、成本测量单位(美元/令牌/API调用)、实验结果表格等详细信息。
可用于图书/PPT/简报的角度
- 在“AI智能体评估”章节中,作为成功指标从单一成功率转向多维成本-成功率矩阵的典型案例。
- 在网络安全运营专题中,说明为什么LLM不能直接“堆算力”解决SOC调查问题,需要专项工具适配。
- 在“开放基础模型 vs. 闭源API”对比中,展示进攻性任务上开放模型的性价比优势。
与既有脉络的关系
已有卡片“AI智能体是否知道任务简单与否?”(2026-07-14)关注通用任务中的复杂度感知与成本优化(E3方法),本卡片补充了安全领域专用场景下的成本-成功率评估,特别区分了进攻性与防御性任务的不同扩展规律,为安全智能体的实用评估提供了新维度,而非仅关注任务复杂度自适应。
原始材料
- 论文:Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents,arXiv:2607.15263v1
- 交互式结果网站:https://evals.frontier.security
- 待核实:论文正文未获取,以上信息均基于arXiv摘要元数据。