知识卡片:MedFailBench:临床医生构建的医疗AI安全边界检测开源基准
一句话结论
MedFailBench 是一个由临床医生构建的开源基准,旨在系统性地识别和分类医疗 AI 模型在不同安全边界(safety gate)上的失效模式,而非仅仅判断模型是否给出正确答案。
英文标题
MedFailBench: A Clinician-Built Open-Source Benchmark for Medical AI Safety Boundary Inspection
英文关键词
medical AI safety, benchmark, safety boundary inspection, failure atlas, clinician-built
事件概述或研究问题
传统医疗 AI 基准主要衡量模型是否知道正确答案。MedFailBench 提出了不同的问题:哪个安全边界(safety gate)失效了? 它提供了一个由临床医生审查的合成案例集,并对每个案例的错误按严重程度(1–5 级)和安全门类型进行标注。当前公开版本(v0.2.1)包含 44 个经临床医生审查的合成案例、严重程度注释、一个实时的 HuggingFace 排行榜预览、一个安全门分类法、一个临床严重程度评分标准,以及一个用于存档模型响应筛选运行的自动化流水线。
方法/产品要点
- 安全门分类法(Safety Gate Taxonomy):定义了六种失效模式——错过紧急升级(missed urgent escalation)、不安全远程给药(unsafe remote dosing)、不安全出院安抚(unsafe discharge reassurance)、证据编造(evidence fabrication)、不安全协议执行(unsafe protocol execution)、来源支持差距(source support gap)。
- 临床严重程度评分标准(Clinical Severity Rubric):将每个错误按 1(最轻)到 5(致命)分级。
- 数据来源:全部为合成案例,经临床医生审查和标注,无患者真实数据。
- 开源与许可:采用 Apache-2.0 和 CC-BY-4.0 许可,托管在 HuggingFace,并分配有 Zenodo DOI(10.5281/zenodo.21205535)。
主要结果或产业意义
- 提供了首个系统化的医疗 AI 安全边界失效分类框架,使研究人员和开发者能够精确诊断模型在哪些临床安全场景下可能失败。
- 自动化的流水线支持对多种模型响应的批量筛选与存档,便于持续监控和对比。
- 当前版本不包含任何模型排名,也未宣称临床有效,旨在作为评估工具而非性能榜单。
为什么重要
- 现有基准(如 MedQA、MedMCQA)只关注“答案是否正确”,忽略了同样危险的“正确但违反安全边界”的情况(例如建议安全但在远程场景下不可执行的剂量)。
- MedFailBench 首次将临床安全边界作为独立评估维度,并提供可操作的分类法,有助于在部署前识别模型的高危失效模式。
- 由临床医生直接参与案例设计和标注,增强了基准的临床相关性。
局限与不确定性
- 规模较小:当前仅包含 44 个合成案例,覆盖范围有限,可能无法涵盖所有临床场景。
- 合成数据:未使用真实患者数据,因此无法直接反映真实世界分布;临床有效性尚未验证。
- 无模型排名:当前版本未提供任何模型的性能分数或排名,因此无法直接用于比较模型优劣。
- 作者信息:仅列出作者 Goktug Ozkan,合作者团队信息待核实。
可用于图书/PPT/简报的角度
- 新范式:从“正确性”到“安全边界”的评估转变,适合作为医疗 AI 安全章节的案例。
- 六种安全门类型:可在演示中逐一列出并给出简短例子,帮助听众理解具体的失效风险。
- 临床医生参与:强调跨学科合作在设计可靠 AI 基准中的价值。
- 开源生态:Apache-2.0 许可方便社区扩展,可作为开源医疗 AI 工具推介。
原始材料
- 论文 URL:https://arxiv.org/abs/2607.15166v1
- DOI:10.5281/zenodo.21205535