论文

FashionLens: 通过任务自适应学习实现多用途时尚图像检索

FashionLens: 通过任务自适应学习实现多用途时尚图像检索

时尚图像检索是当代电子商务系统的基石。实践中迫切需要一种统一的框架,支持多种查询格式和搜索意图。然而,现有方法聚焦于狭窄的检索任务,未能充分捕捉这种多样性。因此,本工作旨在开发能够处理多样真实时尚检索场景的统一框架,实现真正多用途的时尚图像检索。 为建立数据基础,我们首先引入U-FIRE,一个综合性基准,将分散的时尚数据集整合为统一集合,并补充两个人工标注数据集以测试泛化性。在此基础上,我们提出FashionLens,一种基于多模态大语言模型的统一框架。为处理不同的匹配目标,我们设计了Proposal-Guided Spherical Query Calibrator,通过自适应球面线性插值动态地将查询表示转移到任务对齐的度量空间。此外,为缓解不同任务复杂度和数据规模导致的优化不平衡问题,我们开发了Gradient-Guided Adaptive Sampling策略,根据实时学习难度和数据规模先验自动重新加权任务。 在U-FIRE上的实验表明,FashionLens在多样化的检索场景中取得最先进性能,并稳健地泛化到未见任务。数据和代码已公开发布于 https://github.com/haokunwen/FashionLens。

论文精读

TL;DR FashionLens 借助多模态大模型与任务自适应球形校准、梯度引导采样,统一处理多样时尚检索意图,在 U-FIRE 基准上实现最优性能与强泛化。

问题

问题背景

在电子商务领域,时尚图像检索是用户发现商品的核心途径。实际应用要求系统能处理多种查询输入(图片、文本、多模态组合)和搜索意图(同款查找、互补搭配、风格探索),但现有研究长期停留在各自为政的单一任务范式,无法构建统一的检索入口。

现有方法局限

  • 任务碎片化:主流方案针对每个检索子任务(如文本→图像、图像→图像)训练独立模型,不同任务的视觉语义知识无法复用,线上部署需维护多套服务。
  • 意图自适应缺失:模型一旦固定,难以根据用户实际意图动态调整匹配策略,例如从“精确找同款”切换到“推荐相似风格”需额外后处理或模型切换。
  • 基准片面:现有评测集仅覆盖个别任务,缺乏对**未见过任务(OOD)**的泛化测试,无法反映模型在真实开放场景下的能力。

难点与重要性

统一框架的挑战在于多任务目标的度量空间冲突:同款检索依赖细粒度视觉特征对齐,文本检索强调跨模态语义关联,而搭配推荐需学习时尚物品间的复杂关系。联合优化时梯度方向相互拉扯,且任务间的数据量与学习难度极不均衡,导致训练不稳定。此外,时尚语义的细微差别(如材质、版型)对表征能力要求极高。业界对此高度关注,一个真正多用途的检索系统能大幅提升用户购物体验、降低平台维护成本,并加速新场景的冷启动。

行业类比

类似自动驾驶感知需要统一模型同时处理检测、跟踪、分割等多重任务,时尚检索同样需要一个任务自适应的中枢,以动态响应多样化的查询意图。

核心洞察

  • 多意图驱动的统一检索框架:不同于现有面向单一任务的时尚检索方法,FashionLens 在单一模型中同时支持文本、图像、组合查询等多种检索意图,通过任务自适应学习动态对齐查询表示至不同度量空间。这使得模型能够避免为每种意图独立设计特征或后处理流程,从而在 U-FIRE 基准上获得更一致的性能表现,并展现出对未见过任务的强泛化能力。
  • 梯度引导的自适应任务平衡:多任务学习中常因数据规模和优化难度差异导致某些任务欠拟合,FashionLens 提出的 Gradient-Guided Adaptive Sampling 策略利用检索 token 梯度实时量化各任务的学习难度,与数据规模先验结合来自动调整采样权重。相比固定权重或纯启发式采样,该策略让模型动态聚焦于当前困难任务,有效缓解了优化不平衡,在所有评测任务上均获得显著提升。

方法

FashionLens 的方法流程以 多模态大语言模型(MLLM) 为基座,接收任意形式的查询(文本、图像或组合),统一编码后进入两个核心自适应模块,最终输出检索结果。

1. MLLM 编码

查询与候选图像均通过同一 MLLM 的视觉-语言分支编码为高维特征,共享语义空间,避免额外对齐。编码时,将任务描述(如“以图搜同款”或“文本搜属性”)作为指令前缀,使模型初步感知检索意图。

2. Proposal-Guided Spherical Query Calibrator

这是处理多任务度量空间分歧的关键。不同检索任务(如纹理匹配 vs. 款式匹配)需要不同的特征侧重,强行共享单一度量空间会导致性能退化。该模块由三部分组成:

  • 意图导向适应提案: 利用可学习的任务原型(proposal)生成一组基向量,每种代表一种检索意图的“关注模式”;
  • 自适应球面线性插值: 在单位超球面上,根据查询与每个提案的相似度,动态插值得到任务特定的查询向量,使其落入与当前意图对齐的度量子空间;
  • 自适应联合参数化: 通过轻量网络预测插值系数,实现端到端优化。

3. Gradient-Guided Adaptive Sampling

多任务联合训练时,不同任务的数据规模和收敛难度差异巨大。该策略利用检索 token 的梯度实时量化任务学习难度:

  • 对每个 batch 计算各任务损失对检索特定 token 的梯度范数,作为难度指标;
  • 结合预先统计的数据规模先验,通过概率重标定动态调整各任务的采样权重,使训练更关注高难度或数据稀疏的任务,避免简单任务主导优化。

训练目标

采用统一对比损失,将正样本对的校准后查询向量与目标向量拉近,负样本推远,并在多个任务上联合优化。

与同类工作的差异: 不同于以往针对单一检索任务的特化模型, FashionLens 首次将 MLLM 与自适应度量校准及梯度引导采样结合,在统一框架下实现多任务协同,动态适应任务差异而非硬共享参数。

实验

实验设计

实验在统一基准 U-FIRE 上开展,该基准整合了多个碎片化的时尚检索数据集,覆盖文本到图像图像到图像组合查询等多类检索意图。此外,作者额外构建了两个分布外 (OOD) 数据集用于测试模型对未见过任务的泛化能力。评估时采用与任务匹配的检索指标(如 Recall@K),并对比了多种近期多模态检索模型及专门化时尚检索方法,同时通过消融实验验证Proposal-Guided Spherical Query Calibrator (PGSC)Gradient-Guided Adaptive Sampling (GGAS) 两个核心组件的有效性。

关键发现

  1. FashionLens 在多种检索场景下均达到 SOTA 性能,显著优于仅针对单一任务优化的方法,证明了统一框架的可行性。
  2. PGSC 通过自适应球形线性插值,能动态将查询表征映射至任务相关的度量空间,有效解决了异构匹配目标下的表征冲突。
  3. GGAS 基于梯度难度和数据集规模先验动态调整采样权重,缓解了多任务训练中的优化不平衡,提升了整体收敛效率。
  4. OOD 数据集 上,FashionLens 展现出稳健的零样本泛化能力,表明其任务自适应学习策略能捕获跨场景的通用检索知识。

基线对比深度解读

与以往工作中“每任务一模型”的范式不同,FashionLens 首次实现了单个模型处理多样查询。相比 CLIP 等通用双塔模型,FashionLens 通过 MLLM 编码配合 PGSC 校准,在细粒度时尚属性匹配(如纹理、版型)上大幅领先;相比 FashionBERT 等专用预训练模型,其优势在于无需为每种查询格式单独微调,且对组合查询(如“条纹衬衫+黑色长裤”)的语义组合能力更强。消融实验表明,移除 PGSC 或 GGAS 均会导致性能明显下降,尤其是跨意图检索指标,这验证了动态校准和自适应采样在应对多任务异质性时的核心作用。整体上,该工作为时尚领域的通用检索系统奠定了新基线,其思路对多模态检索的工程落地具有借鉴意义。

行业影响

落地场景

FashionLens 作为一个统一时尚图像检索框架,可直接部署于全球时尚电商平台的搜索与推荐系统,支持文本到图像、图像到图像、属性组合查询等多种交互方式,覆盖从“用一张街拍找同款”到“用描述词(如‘波西米亚长裙’)筛选商品”的完整用户意图链。此外,它适用于社交内容平台的“所见即所得”购物链接生成,以及虚拟试衣与搭配推荐应用中的多模态匹配环节。

商业价值

统一框架大幅降低了多任务模型维护成本——不必为每种检索模式单独训练和部署模型,从而减少计算资源与工程开销。其任务自适应校准梯度引导采样策略提升了跨场景检索精度,直接带来更高的点击率与转化率,改善用户购物体验。对于平台,这意味着增收与用户粘性提升;对于技术团队,则简化了算法栈,便于快速迭代与扩展新业务。

与现有产品/工作流的接口

FashionLens 基于 MLLM 架构,可平滑融入现有多模态搜索栈

  • 作为特征抽取层,替代或增强现有的 CLIP 等双塔模型,输出任务自适应嵌入。
  • Query Calibrator 可作为插件式模块接入已有向量检索引擎(如 FAISS、Elasticsearch 向量插件),无需推翻原有索引结构。
  • 训练阶段的自适应采样可结合线上日志系统,实现动态课程学习(Curriculum Learning),使模型逐步适应真实流量分布。

具体落地 Use Case

  1. 跨国时尚零售平台:用户拍摄一张路人穿搭照片上传至 App,后端使用 FashionLens 的图像到图像模式检索相似商品,同时结合文本修饰(“类似款式但黑色”)进行细粒度筛选,结果页展示可直接购买的商品列表,实现**“即看即买”**。
  2. 短视频内容电商:主播展示一套搭配,观众通过截屏发起检索,系统利用 FashionLens 的多任务检索能力,分别识别上衣、下装、配饰,并返回多件商品链接,提升内容变现效率。这些场景均不依赖地域化标签,全球适用。

局限

  • **计算开销与部署效率**:FashionLens 基于多模态大语言模型(MLLM),虽能建模复杂跨模态交互,但推理延迟和显存占用显著高于常规双塔检索模型。在实际电商高并发场景下,需权衡检索质量与实时性,论文未提供模型压缩或量化部署的可行性分析。此外,梯度引导的自适应采样策略虽动态调整任务权重,但引入了额外超参(如难度阈值、先验平滑系数),不同任务组合下可能需要大量调参工作,影响即插即用能力。
  • **数据全面性与长尾覆盖**:U-FIRE 基准整合了多个公开时尚数据集,但主要依赖已有标注,且补充的两个手工数据集规模有限。时尚领域属性粒度极细(如纹理、面料、剪裁),现有指令形式(文本/图像/组合查询)可能仍无法覆盖所有消费者搜索意图,尤其在长尾属性组合上泛化不足。论文主要评估了已知任务分割的迁移能力,对开放式词汇或未见属性组合的检索鲁棒性未做充分验证。
  • **与轻量级方案对比**:该方法与基于 CLIP 的简单微调或感知哈希等轻量方案相比,在简单同款检索任务上性能提升可能不显著,但资源消耗却成倍增加。论文消融实验主要对比模块变体,未深入分析框架在不同复杂度查询下的效率-精度 trade-off,可能高估了统一范式的工程实用性。此外,依赖大规模语言模型的输出作为检索特征,黑盒特性可能导致对检索失败的归因困难,不利于在线系统调试。
论文Haokun Wen2026-05-21原文

相关内容