AI消息速览

ClinMM-Bench:多轮多模态临床诊断推理评估基准

事件日期 2026-07-28 · 学术前沿 · 已接受

事件日期2026-07-28
信息日期2026-07-28
入库日期2026-07-30
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:ClinMM-Bench:多轮多模态临床诊断推理评估基准

一句话结论
现有多模态大语言模型在真实临床诊断中的多轮推理能力仍然有限,即使最优模型也仅有极少数案例能完全正确诊断;ClinMM-Bench 是目前规模最大的多轮多模态临床诊断评估基准,揭示了五种典型失败模式。

事件概述 / 研究问题
临床诊断过程涉及多模态信息的逐步披露、诊断假设的动态更新和推理的持续修正,但现有评估通常基于单轮或孤立任务,无法反映真实临床复杂性。为弥合这一差距,研究团队开发了 ClinMM-Bench,用于系统评估多模态大语言模型在多轮、多模态临床诊断中的表现。

方法 / 产品要点

  • 数据集:包含 1,089 个具有挑战性的真实世界临床病例,共 3,760 张医学图像,覆盖 8 个专科。
  • 评估框架:采用双层评估体系,分别衡量 诊断准确性诊断推理质量
  • 评估模型:对 15 个有代表性的多模态大语言模型进行了系统评估,包括闭源和开源模型。

主要结果 / 产业意义

  • 闭源模型在总体诊断准确性上最高,但所有模型的 完全正确诊断比例仍然有限(具体数值待核实)。
  • 在推理质量方面,当前模型能识别合理的诊断方向,但在生成可靠的诊断推理链条上存在显著局限。
  • 错误分析归纳出五种典型失败模式:信息整合失败(information synthesis failure)、知识映射错误(knowledge mapping error)、感知错误(perception error)、过早关闭(premature closure)以及视觉幻觉(visual hallucination)。

为什么重要

  • 本工作首次将临床诊断的 多轮交互特性 纳入基准测试,填补了现有单轮评估无法模拟真实临床流程的空白。
  • 与已有单轮或孤立任务基准相比,ClinMM-Bench 更贴近医生逐步获取信息、修正假设的真实工作流,为改进模型的临床实用性提供了关键方向。

局限与不确定性

  • 数据集规模(1,089 例)虽为目前最大,但相比临床海量病例仍有限,专科覆盖可能不全面。
  • 评估框架仅关注诊断准确性与推理质量,未涵盖患者沟通、伦理判断等临床软技能。
  • 失败模式分类基于现有错误分析,可能未穷尽所有类型的推理缺陷(如跨模态时序对齐错误)。

可用于图书/PPT/简报的角度

  • 医疗AI评估的新范式:对比单轮 VS 多轮评估的差异,突出 ClinMM-Bench 对临床模拟的真实性提升。
  • 模型能力边界:展示即使最先进模型在“完全正确诊断”上的低比例,警示医疗AI辅助的可靠性风险。
  • 失败模式教学:用五种典型失败模式作为案例,分析模型在信息整合、知识映射等方面的弱点,适合课堂教学或产品改进讨论。

原始材料

  • 英文标题:Evaluating Multi-Turn Multimodal Diagnostic Reasoning on Challenging Real-World Clinical Cases
  • 英文关键词:Multi-turn multimodal clinical diagnosis, Benchmark, MLLMs, Diagnostic reasoning
  • 来源:arXiv: 2607.25933v1, URL: https://arxiv.org/abs/2607.25933v1