知识卡片:ClinMM-Bench:多轮多模态临床诊断推理评估基准
一句话结论
现有多模态大语言模型在真实临床诊断中的多轮推理能力仍然有限,即使最优模型也仅有极少数案例能完全正确诊断;ClinMM-Bench 是目前规模最大的多轮多模态临床诊断评估基准,揭示了五种典型失败模式。
事件概述 / 研究问题
临床诊断过程涉及多模态信息的逐步披露、诊断假设的动态更新和推理的持续修正,但现有评估通常基于单轮或孤立任务,无法反映真实临床复杂性。为弥合这一差距,研究团队开发了 ClinMM-Bench,用于系统评估多模态大语言模型在多轮、多模态临床诊断中的表现。
方法 / 产品要点
- 数据集:包含 1,089 个具有挑战性的真实世界临床病例,共 3,760 张医学图像,覆盖 8 个专科。
- 评估框架:采用双层评估体系,分别衡量 诊断准确性 和 诊断推理质量。
- 评估模型:对 15 个有代表性的多模态大语言模型进行了系统评估,包括闭源和开源模型。
主要结果 / 产业意义
- 闭源模型在总体诊断准确性上最高,但所有模型的 完全正确诊断比例仍然有限(具体数值待核实)。
- 在推理质量方面,当前模型能识别合理的诊断方向,但在生成可靠的诊断推理链条上存在显著局限。
- 错误分析归纳出五种典型失败模式:信息整合失败(information synthesis failure)、知识映射错误(knowledge mapping error)、感知错误(perception error)、过早关闭(premature closure)以及视觉幻觉(visual hallucination)。
为什么重要
- 本工作首次将临床诊断的 多轮交互特性 纳入基准测试,填补了现有单轮评估无法模拟真实临床流程的空白。
- 与已有单轮或孤立任务基准相比,ClinMM-Bench 更贴近医生逐步获取信息、修正假设的真实工作流,为改进模型的临床实用性提供了关键方向。
局限与不确定性
- 数据集规模(1,089 例)虽为目前最大,但相比临床海量病例仍有限,专科覆盖可能不全面。
- 评估框架仅关注诊断准确性与推理质量,未涵盖患者沟通、伦理判断等临床软技能。
- 失败模式分类基于现有错误分析,可能未穷尽所有类型的推理缺陷(如跨模态时序对齐错误)。
可用于图书/PPT/简报的角度
- 医疗AI评估的新范式:对比单轮 VS 多轮评估的差异,突出 ClinMM-Bench 对临床模拟的真实性提升。
- 模型能力边界:展示即使最先进模型在“完全正确诊断”上的低比例,警示医疗AI辅助的可靠性风险。
- 失败模式教学:用五种典型失败模式作为案例,分析模型在信息整合、知识映射等方面的弱点,适合课堂教学或产品改进讨论。
原始材料
- 英文标题:Evaluating Multi-Turn Multimodal Diagnostic Reasoning on Challenging Real-World Clinical Cases
- 英文关键词:Multi-turn multimodal clinical diagnosis, Benchmark, MLLMs, Diagnostic reasoning
- 来源:arXiv: 2607.25933v1, URL: https://arxiv.org/abs/2607.25933v1