知识卡片:AuricularWorld——层级动作引导的世界模型用于CT耳廓结构精细分割
英文标题:AuricularWorld: Hierarchical Action-Guided World Modeling for Fine-Grained Auricular Structure Segmentation from CT Scans
英文关键词:World Model; Hierarchical Action; Latent State-Space Model; Fine-Grained Segmentation; Auricular Structure; CT
一句话结论
AuricularWorld 提出一种基于潜空间世界模型的分割框架,通过在编码器-解码器结构中引入确定性递归状态空间模型,以层级解剖动作迭代细化潜表示,从而在不依赖真值引导的推理过程中提升CT影像中细小、不规则且相互重叠的耳廓结构分割精度,HD95降低超过43%。
事件概述或研究问题
耳廓结构在CT影像中只占据很小的图像区域,软骨边界高度不规则,且软骨与周围软组织之间的界面往往模糊不清。临床标注还可能同时包含“含软骨及邻近皮肤的复合结构”和“仅软骨区域”,导致嵌套和重叠的标签。传统前馈式分割网络难以处理这种复杂解剖结构,因此需要一种能够进行迭代解剖推理的建模方法。
方法/产品要点
- 基于编码器-解码器架构,在中间潜空间引入确定性递归状态空间模型。
- 将多尺度编码器特征与部分解码表示融合,构成结构观测,用于初始化潜变量动力学。
- 推理阶段执行三步潜在该过程(latent rollout),无需真值引导。
- 通过层级解剖动作更新递归状态,逐步细化潜表示。
- 最终将潜轨迹投影回解码器,并结合高分辨率特征得到分割结果。
- 设计“平衡层级动作目标”(balanced hierarchical action objective),缓解前景稀疏、解剖组缺失以及“添加/移除”操作不平衡等问题。
主要结果或产业意义
在针对CT中细小、不规则且重叠的耳廓结构分割实验中,该框架持续提升分割精度,并将HD95降低超过43%。这表明潜世界模型推理对具有挑战性的医学图像分割任务有效。
为什么重要
这是将世界模型思想用于医学图像精细分割的探索,突破了传统前馈网络“单次前向预测”的局限。AuricularWorld 通过潜空间中的迭代解剖推理,为处理标注复杂、边界模糊、目标极小且重叠的医学结构提供了新思路。
局限与不确定性
- 摘要中未说明具体训练/测试数据集、标注来源、患者数量及与哪些基线方法比较。
- 未报告Dice系数或平均表面距离等常用分割指标的具体数值,仅给出HD95相对减少量。
- 方法在非耳廓或其他医学影像任务上的泛化能力待核实。
- 三步潜展开的步数选择依据、推理耗时与计算开销待核实。
可用于图书/PPT/简报的角度
- 世界模型不只用于视频预测与决策,也可以作为医学图像分割的“内部推理器”。
- 如何用“层级动作”来描述解剖结构的添加/移除过程,是潜空间动态建模的一种直观设计。
- 针对小目标、重叠标签、边界模糊等医学影像痛点,AuricularWorld 展示了一种可迭代优化的分割范式。
原始材料
- 标题:AuricularWorld: Hierarchical Action-Guided World Modeling for Fine-Grained Auricular Structure Segmentation from CT Scans
- arXiv ID:2607.28487v1
- 作者:Jingwen Yang, Senmao Wang, Luoyao Kang, Runmeng Cui, Keying Zhang, Yunjia Bao, Haifan Gong, Lin Lin, Haiyue Jiang
- 提交/更新日期:2026-07-30T16:38:30Z
- 分类:cs.CV
- 摘要链接:https://arxiv.org/abs/2607.28487v1
- PDF链接:https://arxiv.org/pdf/2607.28487v1