背景与动机
图1源域(红色)和目标域(蓝色)中的域内和域间变化示意图
跨域人群计数在多媒体和计算机视觉领域具有重要意义,旨在解决由于不同数据集之间的域间差距导致的模型性能下降问题。其目标是准确估算监控图像或视频中的人数,即使在不同的场景和条件下也能保持高性能。这对于公共安全、智能交通和商业分析等领域尤为重要。跨域人群计数不仅能够提高在多种场景中的适应能力,还能在没有充分标注数据的情况下实现准确的人群计数,进而提升模型的实际应用价值。
在跨域人群计数中,存在三项关键现象。首先,域无关因素(如密度、视角和尺度)在同一数据集内导致的变化比在不同数据集之间的变化更显著,这表明这些因素在不同域之间存在不对齐现象。这种现象导致即使在同一域内也会出现显著的性能波动,给模型带来挑战(图1)。其次,随着不同域在分布上的一致性提高,跨域性能趋于改善,这表明对齐域无关因素可以提高模型的跨域性能。这意味着,通过减少不同域之间的差异,可以显著提升模型在新环境中的适应能力。最后,域不对齐对跨域性能的影响甚至超过了源域数据量的影响,尽管某些源域包含更多数据,但在跨域设置中表现不如数据量较少的源域(图2)。这表明,单纯依赖大量数据并不足以解决跨域问题,必须从根本上解决域无关因素的对齐问题。
图2跨域场景中密度分布和模型性能的示意图
基于这些现象,跨域人群计数任务的动机如下:(1)现有方法依赖大量数据标注,难以适用于开放场景,直接迁移标注数据集的效果不佳,限制了模型的实际应用;(2)域无关因素在同一数据集内的变化比在不同数据集之间的变化更显著,导致模型在跨域应用中的性能下降,增加了模型在不同场景中的适应难度;(3)跨域性能在不同域的分布一致性提高时会有所改善,但域不对齐对跨域性能的影响甚至超过了源域数据量的影响,因此,仅依靠增加数据量并不能有效提升跨域性能。解决域无关因素的不对齐问题对于优化跨域模型性能至关重要。为了解决这些挑战,我们提出了一种域无关对齐的最优传输(DAOT)方法,通过对齐域无关因素,实现知识转移和跨域自适应,显著提高群体计数模型的跨域性能。
论文链接:https://dl.acm.org/doi/abs/10.1145/3581783.3611793
arXiv: https://arxiv.org/abs/2308.05311
代码:https://github.com/HopooLinZ/DAOT/
论文《DAOT: Domain-Agnostically Aligned Optimal Transport for Domain-Adaptive Crowd Counting》发表在《Proceedings of the 31st ACM International Conference on Multimedia》(ACMMM)上。ACM Multimedia(ACM MM)是计算机图形学与多媒体领域的顶级会议之一。作为中国计算机学会CCF推荐的A类会议,ACM MM在该领域具有极高的学术影响力和知名度。会议涵盖了多媒体内容分析、多媒体系统、多媒体应用与服务等多个研究方向,是研究人员和行业专家展示最新研究成果和交流前沿技术的重要平台。
方法
DAOT模型通过对齐域无关因素来优化跨域人群计数。具体来说,首先,DAOT模型采用结构相似性(SSIM)作为指标,测量源域和目标域中每个样本的域无关因素(如密度、视角和尺度)的差异。SSIM结合亮度、对比度和结构特性,以全面评估分布之间的差异,从而获取源域和目标域的分布信息。其次,通过引入最优传输(OT)策略,平滑这些个体层次的差异,找到源域和目标域之间的最佳转换路径。为了解决不对齐测量过程中出现的异常个体,每个域增加一个虚拟列,以移除不可靠的样本,确保传输的可靠性。最后,通过对齐的域无关因素进行知识转移,在目标域上再训练模型,以实现跨域自适应。实验结果表明,DAOT模型在多个标准群体计数基准测试中表现出色,具有很强的泛化能力和鲁棒性。通过这种分布感知方法的协同作用,DAOT模型能够在源域和目标域之间有效对齐域无关因素,减少生成数据和真实数据之间的分布差异,提升跨域识别的准确性和鲁棒性。具体框架如图3所示。
图3 DAOT框架图
本文将域自适应问题分为个体对齐和域对齐两个部分。个体对齐部分旨在通过测量个体层次的差异来对齐域无关因素,从而弥合域间差距。我们认为,域无关因素在跨域和域内都具有可变性,使得单个图像不完全属于特定域,而这些因素在域层次上的不对齐导致了域间差距。为了解决这一问题,我们首先将源域和目标域中的图像划分为不同的区域,分别形成集合。通过源域模型和初步的目标域模型的分布感知,获得源域分布和目标域分布。在描述域无关因素时,由于分布的多样性随着规模增加而增加,在不改变图像本身的情况下进行个体层次的对齐是具有挑战性的。我们采用位置敏感的分布感知模型FIDT,通过SSIM计算每个区域的结构相似性,结合亮度、对比度和结构特性,以全面评估分布之间的差异。通过这种方法,可以充分结合这些信息,确保对齐的准确性。为了确保距离矩阵的可靠性,我们在距离矩阵中设置了新列,移除不可靠的行和列。这些新列用于表示每个源域样本分布与标准分布之间的SSIM值,以及每个目标域样本分布与标准分布之间的SSIM值,通过这些设置来确保距离矩阵中每个元素的可靠性。
图4最优传输细节
域对齐部分旨在将跨域适应任务转化为域无关因素对齐问题,并在域级别分布之间找到最佳映射。我们采用Sinkhorn算法来求解最优传输问题,该问题的最终目标是找到一个矩阵,以最优方式将源域分布传输到目标域分布,从而最小化整体传输成本。如图4所示,首先,使用Sinkhorn算法来解决最优传输问题,该算法计算从源域到目标域的最优传输计划,并返回一个源域和目标域元素之间的映射,该映射最小化了传输计划的整体成本。Sinkhorn算法是匈牙利算法的可微版本,通常用于二分匹配问题。该算法涉及对矩阵的行和列进行迭代归一化,类似于行和列的Softmax操作。在这种情况下,DAOT使用结构相似性指数(SSIM)计算离散的传输成本矩阵。
在求解过程中,算法更新矩阵的行和列,以确保边际匹配给定的权重,并防止零除问题的出现。通过反复迭代行和列的缩放过程,最终传输计划收敛到一个稳定的解。算法在达到最大迭代次数时停止。一旦使用Sinkhorn算法获得了最优传输计划,我们就可以使用它在源域和目标域之间获得映射。这个映射表示源域和目标域样本之间的对应关系,可以用来训练一个能够将源域样本转化为目标域样本的模型。具体来说,我们通过找到在源域中与每个目标样本配对概率最高的索引来获取映射。只有在对应概率值非零的情况下,我们才考虑源域和目标域样本之间的对应关系。最终,我们通过该映射获得分布来微调初始模型,从而获得最终的目标域模型。这一过程确保了源域和目标域之间的最佳对齐,提高了跨域模型的适应能力和性能。
评价和结果
为了评估DAOT的有效性,本小节将其与其他最先进的跨域方法进行比较。我们通过五组适应性实验进行定量评估,报告在目标集上预测的密度图与真实密度图之间的误差。我们将DAOT与三种类型的计数方法进行比较:(1)无域适应的最先进计数方法,(2)Syn-Real域适应方法,以及(3)Real-Real域适应方法,同时还包括我们的基线方法FIDT。值得注意的是,Syn-Real方法的源域为大规模合成的GCC。如表1所示,DAOT在五组实验(A2B、A2Q、N2A、N2B和J2B)中取得了最佳性能,并在其他组别(Q2A、Q2B和J2Q)中取得了次佳性能。尤其在A2B和N2B的设置中,相较于其他方法有显著的提升。DAOT在所有8种设置中均优于基线方法,并在多种设置中优于基于相似性的FGFD方法。与D2CNet相比,DAOT在源域为Q的组别中稍逊于D2CNet,这表明D2CNet在该组别中更具优势,而DAOT则表现出更强的泛化能力。与C2MoT相比,DAOT略低于C2MoT,但用于再训练的数据量远低于C2MoT,并且C2MoT更依赖于大量数据。当目标域为B时,DAOT通常表现更佳,这证明了它在稀疏密度分布上的更强拟合能力。在A2Q和N2B设置中,随着域无关因素的对齐,DAOT方法能够进一步提高出色的性能。
表1:与SOTA方法的实验比较结果
为了实现群体计数中的域自适应,我们将其转化为域无关因素对齐问题,并采用最优传输(OT)来找到分布之间的最佳传输距离。在各项实验中,表2显示,使用所有因素能够在所有实验中达到最佳性能。特别是在Q2A实验中,OT显著提高了性能。仅使用伪标签和SSIM也取得了次佳性能,表现略优于仅使用源域数据。这表明,调整密度分布的错位能够弥合域间差距,从而实现更好的域自适应效果。
表2:不同因素的实验结果
本文的目标是在使用OT之前,通过测量源域和目标域之间的分布距离来找到最优传输路径。OT最终能够获得更合理的分布距离。距离测量方法对于最终解决方案至关重要,我们针对不同的相似性度量方法进行了消融研究,结果如表3所示。三种距离度量方法相比仅使用源域数据都有一定的改进,尤其是使用结构相似性指数(SSIM)时,性能提升最为显著。
表3:不同距离度量方式的实验结果
在跨域密度图预测的定性分析部分,为了直观展示不同方法的跨域性能,我们对图5进行了可视化。图中展示了DAOT方法在多种场景下优于其他方法的表现,包括从密集到稀疏(B2A)、从大规模到小规模(Q2A),甚至从小规模密集到大规模(A2Q)。特别是在Q2A设置中,DAOT的预测非常接近于真实值。在前两行(Q2A和A2Q)中,背景的错误分类较少,而在第三行(A2B)中,人群的估计更加准确。这些部分我们用红框进行了标注,清晰地展示了DAOT方法在不同场景下的优越性。
图5跨域预测密度图展示
我们在图6中展示了不同设置下的分布匹配结果,按从稀疏到密集的顺序排列。从图中可以看出,我们的方法在每组实验中对密度、头部规模和感知等分布进行了对齐,效果显著。特别是在A2Q设置的第三行中,左右两侧的区域在人群密度、规模、感知甚至背景因素方面都极为相似。此外,在A2B和Q2A设置的第一行中,即使在没有人的情况下,也展示了类似的背景匹配结果。这些结果证明了我们的方法能够对齐各种人群分布因素,有效地实现跨域适应。
图6域间分布对齐展示
综上所述,在群体计数的域自适应任务中,我们发现许多数据域内的差异大于域间差异。然而,即使在大规模的源域中,模型在跨域任务中的表现仍然显著劣于在源域中的表现。我们的研究表明,这主要是由于域无关因素在不同域之间的不对齐,严重影响了模型的跨域性能。因此,我们提出通过在源域和目标域中使用最优传输对齐域无关因素,从而弥合群体计数中的域间差距。与以往只处理单个分布的域自适应方法不同,我们的方法首次考虑了整个数据域的整体分布,并在多个数据集上实现了最佳性能。
技术贡献
本研究的贡献包括:我们提出了DAOT模型,通过对齐域无关因素(如密度、视角和尺度),显著改善了跨域人群计数的性能。与以往的方法不同,我们首次考虑了整个数据域的整体分布,并引入最优传输(OT)策略来找到源域和目标域之间的最佳转换路径。采用结构相似性(SSIM)作为距离度量,全面评估分布之间的差异,提高了对齐的准确性。通过在多个标准群体计数数据集上的广泛实验,我们验证了DAOT模型在各种跨域设置中的卓越表现,展示了其强大的泛化能力和鲁棒性。这项工作为解决跨域人群计数任务提供了一个新的视角,强调了解决域不对齐问题的重要性,不仅对跨域任务有显著提升,也为其他相关应用提供了潜在的解决方案。
详细内容参见
Zhu, H., Yuan, J., Zhong, X., Yang, Z., Wang, Z., & He, S. (2023, October). DAOT: Domain-Agnostically Aligned Optimal Transport for Domain-Adaptive Crowd Counting. In Proceedings of the 31st ACM International Conference on Multimedia (pp. 4319-4329).
作者介绍
第一作者朱慧琳目前是武汉理工大学计算机与人工智能学院的三年级博士生,研究方向包括人群计数、迁移学习、计算机视觉。她在顶级国际会议和期刊上发表了多篇论文,包括ACM MM、TMM等,并在多个会议和期刊中担任审稿人。他的主要研究成果包括:1.DAOT: Domain-Agnostically Aligned Optimal Transport for Domain-Adaptive Crowd Counting,ACM MM 2023. (第一作者,CCF A类会议) 2. Find Gold in Sand: Fine-Grained Similarity Mining for Domain-Adaptive Crowd Counting, TMM 2024. (第一作者,中科院一区,JCR Q1,IF 6.5) 3. Fine-grained fragment diffusion for cross domain crowd counting ACMMM 2022. (第一作者,CCF A类会议) 4. Striking a balance: Unsupervised cross-domain crowd counting via knowledge diffusion. ACM MM 2023. (第三作者,CCF A类会议)。
通讯作者钟忺,武汉理工大学计算机与人工智能学院教授,博士生导师,武汉大学学士,华中科技大学博士,佛罗里达大学、北京大学和南洋理工大学访问学者。长期致力于跨媒体分析、图像处理、行为识别和神经形态计算等以人为中心的研究,主持和骨干参与了国家自然科学基金面上项目等10余项纵向项目,并主持起草了1项省地方标准。其研究成果已广泛应用于武汉市多个城市道路和隧道智能监控系统,创造了超过3亿元的社会经济效益。荣获湖北省教学和科技奖励5项,出版专著5部,在权威期刊和会议上发表论文100余篇,其中SCI一区或CCF A类论文18篇,授权发明专利12项。指导学生在国际旗舰会议ICME挑战赛中获冠军、互联网+大赛中获省银奖、中国机器人大赛获全国一等奖,中国软件杯大赛中获全国三等奖。任IEEE高级会员、CCF高级会员、CCF YOCSEF武汉副主席、CCF多媒体技术专委会执行委员、CSIG高级会员、CSIG多媒体专委会和交通视频专委会委员、武汉计算机软件工程学会理事。