背景与动机
跨模态内容检索作为当代智能软件的重要功能,使用户能够通过单一模态的查询获取跨模态的丰富数据,增强信息访问的灵活性并极大提升用户体验,同时在理解复杂查询意图和提供综合服务方面发挥着关键作用。跨模态检索在语义理解、模态关联和信息融合等技术挑战上的进展,持续推动着智能软件的发展和创新。其中,跨模态表征学习最近从视觉语言预训练(VLP)中获益匪浅。一个典型的例子是 CLIP,作为一个任务无关的跨模态模型,在 4 亿个图像-文本对上进行了训练,并在各种下游视觉任务中表现出令人印象深刻的零误差性能。然而,本项工作发现在某些跨模态任务(如食谱检索)中直接使用 CLIP 的效果并不理想。跨模态食谱检索是一项新兴的视觉-文本检索任务,旨在将食物图像与相应的食谱进行匹配。尽管大规模视觉语言预训练(VLP)模型在各种下游任务中都取得了令人印象深刻的表现,但由于以下两个问题,它们在这些跨模态检索任务中表现不如人意:(1)食物图像和食谱的特征需要对齐,简单地微调预训练 VLP 模型的图像编码器并不能明确帮助实现这一目标。(2)食谱中的文本内容比 VLP 模型预训练语料库中的文本标题更有结构性,使得VLP 模型无法适应食谱检索任务。在本文中,我们提出了一种组件感知的特定实例提示学习(CIP)模型,它能充分发挥大规模 VLP 模型的能力。CIP 使我们能够学习结构化的食谱信息,因此无需微调即可对齐视觉-文本表征。此外,我们还构建了一个基于分层变换器的食谱编码器,称为自适应食谱合并器(ARM),鼓励模型学习更有效的食谱表征。在公开的 Recipe1M 数据集上进行的大量实验证明了本项工作所提方法的优越性,在跨模态食谱检索任务中的表现优于最先进的方法。
论文链接:https://dl.acm.org/doi/10.1145/3581783.3612193
论文《Improving Cross-Modal Recipe Retrieval with Component-Aware Prompted CLIP Embedding》发表在《ACM International Conference on Multimedia》(MM '23)上。ACM 国际多媒体会议(ACM International Conference on Multimedia)是计算机科学多媒体领域的首要国际会议,也是CCF A类会议。
方法
在一个具有代表性的跨模态食谱数据集 Recipe1M中,需要进行跨模态联合学习将食品标题、配料表、烹饪说明和图像嵌入到一个共同的特征空间中。虽然大规模 VLP 模型无疑具有强大的跨模态特征提取能力,但如何有效利用这些模型来辅助跨模态任务仍需进一步探索。在这项工作中,我们发现了 CLIP 模型运用到跨模态食谱检索任务中的两个问题:(1)考虑到两种模态的特征需要对齐,仅仅采用 CLIP 预先训练好的图像编码器并不能明确帮助实现这一目标,同时也没有足够的数据对 CLIP 模型进行微调。(2)食谱中的文本内容比 CLIP 预训练语料库中的文本标题更有结构性,这使得 CLIP 的文本编码器无法通过微调来适应这项任务。在本文中,本项工作提出了一种称为"组件感知实例特定提示学习"(Component-aware Instance-specific Prompt learning,CIP)的模型。在 CIP 中,我们首先采用食谱中的三个成分名称作为提示的主要内容,即 "标题"、"配料 "和 "说明",然后分别为每个成分生成提示前缀。我们将提示前缀设置为连续的可学习向量,为了避免弱泛化问题,我们用特定实例的视觉嵌入来丰富每个提示。然后,将提示信息送入预先训练好的文本编码器,以获得组件感知的提示嵌入,并通过交叉关注机制将其与原始视觉嵌入进一步融合。最后,我们就得到了用于后续检索任务的提示视觉嵌入。如图 1 所示,CIP 无需进行任何繁琐的微调就能生成与任务相关的提示嵌入。
至于提取和整合文本食谱内容,一份食谱中通常有多种配料/说明,而这些配料/说明在检索任务中的权重并不相同。例如,有些调味品会出现在许多食谱中,但在食物图像中通常并不可见。现有的大多数方法都是分别提取每种配料/说明的特征,然后通过平均池化将其整合到食谱级特征中。这些方法往往会受到与检索任务无关的特征的干扰。为了解决这个问题,我们用自适应成分池化(ACP)取代了平均池化,以学习各类配料/说明的重要性。重要性系数的计算方法考虑到了不同成分/指令序列的长度。然后,我们根据重要性系数将序列嵌入整合到联合配方嵌入中。此外,本项工作提出了跨组件合并(CCM)模块,结合了模内交互,有助于获得更好的配方级表征。在 CCM 中,我们允许每个组件的特征在合并前通过交叉注意变换器解码器(CTD)感知其他组件。我们基于多层Transformer将 ACP 和 CCM 整合在一起,建立了我们的食谱编码器,称为自适应食谱合并器 (ARM)。
图 2展示了我们提出的方法的整体架构。在本文中,我们旨在通过组件感知提示 CLIP 嵌入来改进跨模态食谱检索。我们首先提出了组件感知实例特定提示学习(CIP)模型,通过将每个组件拼接到可学习的提示前缀来构建组件感知提示。通过图像编码器获得图像嵌入𝐼后,提示前缀将根据特定实例提示编码器计算出的实例嵌入更新。然后,我们将所有提示符输入文本编码器,以获得提示符嵌入。以图像嵌入词𝐼作为查询,以提示嵌入词作为键和值,通过交叉注意前解码器(CTD)得到提示图像嵌入词𝐼𝑝。同时,我们通过自适应食谱合并器(ARM)中的分层变换器提取标题、配料和说明的嵌入。利用自适应成分池(ACP)聚合配料和说明序列后,我们利用 CTD 进行跨成分交互。最终得到的食谱嵌入𝑅和提示图像嵌入𝐼𝑝被用于跨模态检索任务。
评价和结果
本项研究在 Recipe1M 数据集上比较了我们与 SOTA 方法的实验结果,以证明我们方法的有效性。我们引用了其他方法原始论文中的结果。如表 1 和表 2 所示,我们的方法在所有评估指标上都达到了最高性能。以 1k 测试集为例,在图像到食谱和食谱到图像检索方面,我们的 R@1、R@5、R@10 分别比 Papadopoulos 等人[21]的现有 SOTA 方法高出 10.2%、3.3%、2.1% 和10.5%、4.6%、2.4%。至于 10k 测试集,RDE-GAN通过排除菜肴形状和上菜方式等非食谱噪声,在 R@1 方面取得了优异的结果,但我们的方法在两种模式下仍分别获得了 8.9% 和 7.0% 的 R@1 提高。同时,在 10k 双向检索中,与 H-T(ViT) 相比,我们的方法在 R@5 和 R@10 方面保持了优势,分别提高了 10.6%、9.1% 和 10.8%、9.1%。此外,我们还获得了最佳的MedR(代表所有正确检索结果的中位排名)。我们的模型显著提高了双向检索性能,这得益于我们提出的组件感知实例特定提示学习(CIP)和自适应配方合并(ARM)。与各种基准方法和评估指标的对比实验证明了我们模型的优越性。
技术贡献
本文的主要贡献可归纳如下:
-本项研究提出了一种组件感知的特定实例提示学习(CIP)模型,它充分利用了大规模 VLP 模型的能力来改进跨模态食谱检索任务。据我们所知,我们是第一个通过提示学习将CLIP模型实现在这一任务中的。
-为了更好地提取和整合结构化食谱,本项研究构建了一种新的食谱编码器,称为自适应食谱合并器(ARM),它有助于生成更好的食谱表征。
-本项研究在 Recipe1M 数据集上进行了实验,结果表明我们提出的方法性能优越,在跨模态食谱检索任务软件上优于最先进的方法。跨模态检索在语义理解、模态关联和信息融合等这类技术挑战上的进展,持续推动着智能软件技术领域的发展和创新。
详细内容参见
Xu Huang, Jin Liu(Corresponding aurhor), Zhizhong Zhang, and Yuan Xie, Improving Cross- Modal Recipe Retrieval with Component-Aware Prompted CLIP Embedding. In Proceedings of the 31st ACM International Conference on Multimedia (MM ’23), October 29–November 3, 2023, Ottawa, ON, Canada. ACM, New York, NY, USA, 9 pages, CCF A类会议. https://doi.org/10.1145/3581783.3612193
作者介绍
黄旭2022年于武汉大学计算机学院获得硕士学位,目前正在攻读博士学位。他的研究兴趣包括深度学习、多模态学习和计算机视觉。
刘进是本文通讯作者,2005年于武汉大学软件工程国家重点实验室获得博士学位,是武汉大学计算机学院的三级教授、CCF软件工程和服务计算专委委员,研究兴趣包括跨模态智能软件服务和工业软件,在TSC、TSE、TOIS、TKDE、TASLP、ICOSC、ICWS、MM、ASE、ACL、EMNLP等知名期刊和会议上发表了多篇学术论文。
张志忠于2020年在中国科学院自动化所获得模式识别与智能系统专业的博士学位,目前是华东师范大学计算机科学与技术学院的副教授,研究兴趣包括图像处理、计算机视觉、机器学习和模式识别。
谢源于2013年在中国科学院自动化研究所获得了模式识别与智能系统的博士学位,是华东师范大学计算机科学与技术学院的教授,已在诸如IJCV、TPAMI、TIP、CVPR、ECCV、ICCV、NeurIPS、AAAI、IJCAI和MM等主要国际期刊和会议上发表了80多篇论文,研究兴趣包括图像处理、计算机视觉、机器学习和模式识别。