知识卡片:多意图多轮时尚图像检索
英文标题:Diverse-Intent Multi-Turn Fashion Image Retrieval
英文关键词:multi-turn retrieval, fashion retrieval, diverse intent, MLLM-VLP, DIM-Fashion, FashionAM
原始来源:https://arxiv.org/abs/2607.20291v1
一句话结论
本文提出 DIM-Fashion 基准和 FashionAM 框架,直接对齐多模态对话查询与时尚图库嵌入空间,避免中间文本化带来的信息损失,从而解决多轮时尚图像检索中意图多样化的实际问题。
事件概述或研究问题
真实世界的时尚搜索通常是多轮交互过程,但现有多轮检索方法均基于一个限制性假设:每轮交互都遵循相同的属性编辑范式(attribute-editing paradigm),忽视了异构意图转换(heterogeneous intent transitions)。此外,已有方法常依赖文本化(textification)来桥接多模态查询与视觉检索,这可能会丢失细粒度的视觉线索。本研究旨在填补这些空白。
方法/产品要点
- DIM-Fashion 基准:包含 26K 多轮会话,由 13 个时尚检索数据集(覆盖 7 个任务)构建而成,具备多样化的意图转换和回退行为(rollback behaviors)。
- FashionAM 框架:一种 MLLM-VLP(多模态大语言模型-视觉语言预训练)框架,直接将多模态对话查询与时尚导向的图库嵌入空间对齐,避免中间文本化步骤。
主要结果或产业意义
- 大量实验表明 FashionAM 在现有方法中表现更优(具体指标待核实)。
- 对于电商时尚搜索场景,可提升多轮交互中的检索灵活性和准确性,更贴近真实用户行为。
为什么重要
本文是首次系统性地探索多轮时尚图像检索中的意图多样化问题,突破了以往只处理单一属性编辑范式的局限。相比已有工作(如仅关注单轮组合检索或同质化多轮交互),本工作引入了异构意图转换和回退机制,并提出了无需中间文本化的直接跨模态对齐方案,更具实用价值。
局限与不确定性
- 基准数据集和代码将在接收后公开,目前无法验证具体实验细节和数值结果。
- 摘要未提及方法的计算开销、对长轮次会话的鲁棒性以及跨领域(如非时尚场景)的泛化能力。
可用于图书/PPT/简报的角度
- 技术演进角度:从“文本化桥接”到“直接多模态对齐”的范式转变。
- 应用角度:如何利用多轮交互中的意图多样性提升电商搜索转化率。
- 研究角度:多轮检索中异构意图建模与回退行为的设计思路。
原始材料
- arXiv 论文:Diverse-Intent Multi-Turn Fashion Image Retrieval (2607.20291v1)
作者:Mingqiang Tang, Haokun Wen, Meng Liu, Yupeng Hu, Weili Guan, Xuemeng Song
发表于:2026-07-22
摘要链接:https://arxiv.org/abs/2607.20291v1