知识卡片:ReMiX-MAE:从RGB-only临床面部视频学习缺失通道跨模态表征用于交感介导疼痛评估
- 英文标题:ReMiX-MAE: Learning Missing-Channel Cross-Modal Representations from RGB-Only Clinical Facial Videos for Sympathetic-Mediated Pain Assessment
- 英文关键词:ReMiX-MAE; Masked Autoencoder; Multimodal Pretraining; RGB-only Deployment; Pain Assessment; Facial Videos; Thermal; Depth; Self-supervised Learning
一句话结论
ReMiX-MAE 提出一种自监督多模态掩码预训练框架,在训练时使用同步的 RGB、热成像和深度面部视频,并显式训练对模态缺失的鲁棒性,从而在推理阶段仅用 RGB 视频也能取得比单纯 RGB 掩码自编码器更稳定的疼痛评估表现;它还配套收集了一个带视频级自报标签和纵向治疗轨迹的“交感介导疼痛”(SMP)数据集。
事件概述或研究问题
- 临床中自动疼痛评估困难:标注稀缺且是弱标签(常为序列级自我报告);疼痛线索在 RGB 视频中可能细微或接近中性;热成像和深度信号有信息量,但常规临床部署不切实际。
- 研究目标:让模型从多模态视频中学习可迁移的面部表征,并能在实际部署时只依赖 RGB 信号。
方法/产品要点
- 提出 ReMiX-MAE(Reconstructing Missing Channel Cross-Modal Masked Autoencoder),一种自监督多模态掩码预训练框架。
- 输入为同步的 RGB、热成像、深度视频;预训练时通过重建缺失通道的跨模态表示,让模型学会处理模态缺失。
- 支持 RGB-only 部署:训练后 RGB 可单独用于推理;还可用 RGB 解码出“伪多模态特征”(pseudo-multimodal features)以增强表示。
- 收集 SMP(Sympathetic Mediated Pain)数据集:包含患者多次就诊时配对的治疗前/后录像,具有视频级自我报告与纵向治疗轨迹;具体规模材料未给出,待核实。
主要结果或产业意义
- 在 SMP 上,ReMiX-MAE 的 RGB-only 部署一致优于仅用 RGB 的掩码自编码器基线;在具有挑战性的五分类设置中,伪多模态特征带来额外提升。
- 在外部数据集上,ReMiX-MAE 比 RGB-only 基线表现出更强的鲁棒性和标签效率(label-efficient)迁移性,适合数据有限的临床场景。
- 产业意义:可为医院/诊所提供一种部署成本低(只需 RGB 摄像头)、但利用多模态知识训练的自动疼痛评估方案;具体准确率、样本量等未在摘要中披露,待核实。
为什么重要
- 不同于一般多模态融合方法,ReMiX-MAE 专门强调训练期多模态、推理期单模态(RGB)的“缺失通道”跨模态表征学习,缓解临床部署中热成像/深度设备不普及的瓶颈。
- 与已有相关卡片相比,它属于多模态表示学习的新应用场景:面向临床面部视频,且将缺失模态鲁棒性与自监督掩码预训练结合;同时提供了纵向的 SMP 数据集作为增量贡献。
局限与不确定性
- 摘要未给出定量指标(如准确率、AUC)、数据集规模、基线细节;这些均需核实原文或完整论文。
- “伪多模态特征”的生成机制、是否依赖特定网络结构、对热成像/深度缺失比例的鲁棒性等细节在摘要中未说明,待核实。
- 外部数据集具体名称和领域未在摘要中列出,待核实。
- 论文发布时间为 2026-08-03,版本 v1;是否经过同行评议等信息待核实。
可用于图书/PPT/简报的角度
- 用一张三模态(RGB、热成像、深度)面部视频示意图配合“训练时多模态、部署时单模态”的流程,展示临床 AI 的实用化思路。
- 以“疼痛表情不只在可见光里”引出多模态学习,讲解弱标签视频数据下自监督预训练的价值。
- 与已有“面向任意模态缺失的多模态分类共学习方法”卡片对比,突出“从多模态迁移到单模态”与“RGB-only 部署”这一更贴近实际落地的设定。
与既有脉络的关系
- 本条与“面向任意模态缺失的多模态分类共学习方法”有相似之处:都关注推理时模态缺失;但本方法的重点是缺失热成像/深度通道后的 RGB-only 部署,且引入掩码自编码器和临床疼痛评估数据集。
- 与 MIRROR 不同,ReMiX-MAE 面向感知/分类任务,而非多模态推理/理解任务。
原始材料
- 英文标题:ReMiX-MAE: Learning Missing-Channel Cross-Modal Representations from RGB-Only Clinical Facial Videos for Sympathetic-Mediated Pain Assessment
- 英文关键词:ReMiX-MAE; Masked Autoencoder; Multimodal Pretraining; RGB-only Deployment; Pain Assessment; Facial Videos; Thermal; Depth; Self-supervised Learning
- 原始来源:https://arxiv.org/abs/2608.02561v1 (arXiv:2608.02561v1,cs.CV,2026-08-03)