背景与动机
随着计算机视觉和深度学习技术的迅猛发展,行为识别在安全监控、智能交互、虚拟现实、健康护理等多个领域显示出了巨大的应用潜力。尽管取得了一定的成绩,但由于视频中存在的复杂环境,多视角行为识别仍然是一个极具挑战的课题。本项工作发现行为识别在多视角环境下会被不平衡的信息所干扰,不同视角下的行为特征贡献度不同,导致一些重要特征被忽视,同时在不同视角信息融合过程中存在重叠或冗余的特征,造成多视角模型对某些特征赋予过多权重忽视其他关键信息,最终影响行为识别对主要行为特征的准确判别。本项工作基于同一个行为在某个遮挡视角很容易混淆网络对特征捕捉的发现提出视角模糊问题。并针对该问题提出双推荐解纠缠网络(Dual-Recommendation Disentanglement Network,DRDN)的多视角行为识别方法,其核心思想为动态选择不同视角的权重信息,充分利用不同视角下行为类别的同构特质进行互相补充。具体可以从3方面分析双推荐解纠缠网络DRDN的贡献:(1)新问题。我们从信息分解的角度分析行为识别任务,提出了多视角场景下的视角模糊问题,克服以平等权重处理不同视角产生的不稳定预测,从一个新的角度剖析多视角任务。(2)新框架。在新问题的基础上,我们引入了金字塔动态推荐(Pyramid Dynamic Recommendation,PDR)来挖掘有用的知识,指导框架以动态选择的方式处理行动信息。(3)独立关系。我们考虑利用视角和行为之间的关系为(Specific Information Recommendation,SIR)模块构建正样本和负样本,以最大化视角和行为之间的距离。将对比学习与特征分解相结合以获得完整的行为信息。与之前的方法不同,我们关注采用互学习的原则来联合训练众多视角,在标准多视角数据集NTU-RGB+D 60及N-UCLA上达到了92.9%及93.9%的准确率,达到领域内先进水平,同时提出不同实验设置验证了面向视角模糊问题时DRDN的有效性。
论文链接:https://ieeexplore.ieee.org/document/10122859论文《Dual-Recommendation Disentanglement Network for View Fuzz in Action Recognition》发表在《IEEE Transactions on Image Processing》(TIP)上。IEEE TIP全称为IEEE图像处理汇刊,是中科院SCI期刊分区大类分区一区TOP期刊、中国计算机学会CCF推荐的计算机图形学与多媒体领域的三大A类期刊之一,发表当年影响因子为10.6。
方法
DRDN将观察到的外观特征看作视角和行为特征的组合,通过解耦后这两个特征之间的自适应协作表示,充分利用视角和行为间的互补和互斥关系。对于行为,利用多层次的特定信息推荐SIR模块来增强复杂活动和视角之间的交互。该模块综合考虑全局和局部信息之间的权衡,提供了更全面的行为表征。对于视角,利用金字塔动态推荐模块PDR学习一个完整的全局表示,从不同的视角学习视角特定信息,减少从其他视角获得的干扰信息以抵抗模糊噪声的影响。PDR引导行为解开视角与行为之间的特定信息,而SIR利用视角和行动特定信息之间的互斥性,构建正负样本对整个解耦网络进行约束,具体框架如图1所示。
图 1 DRDN框架图
DRDN首先将多视角视频送到ResNet 3D中以获得n个视角的特征,表示为{X1,X2,···,Xn}。同一视角下的不同行为表示为{Y1,Y2,···,Yn},其中Xi和Xj示相同行为的两个不同视角,而Yi和Yj表示每个视角的相同视角的两个不同行为。金字塔动态推荐模块从多视角特征中提取行为的全局特征X。在PDR之后,解纠缠网络通过级联全局特征X和第i个视角特征Xi来捕获特定于行为的特征和特定于视角的特征。DRDN网络中使用的多个PDR模块共享权重参数。受到动态网络工作的启发,DRDN提出金字塔动态推荐(PDR)模块,利用多层分级方式将行为特征提炼的更纯净。与直接融合相比,动态选择融合摒弃了扰动和模糊的视角信息,显著提高特征的表达能力。PDR采用Dirichlet分布,可以在视角模糊环境中借助不同视角置信度进行判断,通过结合样本的可靠程度灵活调整权重。金字塔架构允许通过逐层权重提供不同特征的排序结果,从而找到适合的属性推荐给后面的层。在整个过程中,具有模糊视角信息的特征可以被逐渐地稀释。通过这种方式,DRDN能够有效地从多个视角中提取有益的信息,并在不同层级之间实现信息的有效传递与聚合。
图 2 金字塔动态推荐PDR(绿色和蓝色圆圈单元分别代表计算单元和传输单元,其中 是加权单元, 代表多视角特征)
此外,DRDN提出特定信息推荐(SIR)模块,该模块由两部分组成:行为特定对比信息(Action-Specific Contrastive Information,ASCI)子模块和视点特定交互信息(View-Specific Mutual Information,VSMI)子模块。ASCI将来自不同视角的具有相同行为的特征分类以构造正样本和负样本。正样本由来自相同视角的视角特征和行为特征组成,负样本由来自不同视角的视角特征和行为特征组成。该方案遵循两个正样本对之间的距离小于负样本对之间的距离的原则,迫使行为和视角信息之间的更彻底的解纠缠。对于每个视角,VSMI模块学习 和之间的相互线索以从相同视角中的不同行为导出行为表示 和视角表示 。通过ASCI和VSMI的协同训练提取行为特征,约束视角特征与行为特征分离。和 代表DN模块后的分离特征。指的是视角特定特征, 是输入视频的行为特定特征。代表第 个视角的特定行为信息。
图 3 特定信息推荐SIR
评价和结果
本文针对视角模糊问题,采用N-UCLA数据集及IXMAS进行实验。针对常规多视角问题,采用NTU-RGB+D 60及N-UCLA数据集进行实验。为了完整起见,DRDN与采用不同模态数据训练的方法进行了详细比较,包括骨架模态、可见光+深度模态和可见光模态,结果如表1所示。DRDN方法侧重于解决不同视角间信息的关系,揭示出模糊视角在现有方法中被平等对待的弊端,因此可以在不同数据集中达到先进水平,突显了DRDN相对于各种现有技术的有效性和鲁棒性。DRDN方法在可见光模态中超过了方法Conflux LSTM和方法CVAM,在CV识别方面取得了平均93.9%的结果,跨视角评估中分别高出5.0%和10.8%,证明了该方法的显著优越性。方法TSN和方法Conflux LSTM优于其他方法,是因为TSN和Conflux LSTM利用时间关系将框架连接起来,可能会增加视角之间的时序维度的连接。在跨视角的实验过程中发现,改变视角会导致明显的视觉变化其中包括显著的遮挡现象。但在这种情况下,DRDN不借助额外辅助信息,在可见光模态中相对于现有方法仍然表现出色。在NTU-RGB+D 60数据集上,DRDN通过充分利用多个视角和不同感知行为的信息,使得模型在CV和CS设置下分别达到了约92.9%和91.2%的准确率。
为了探索模糊环境下行为识别的性能,本文征求了多位研究者的意见对N-UCLA数据集中的综合模糊情况进行了统计。在视角1中,有超过10.0%的视频出现视角模糊的情况,在视角2和视角3中,视角模糊占全部视频的比例分别为2.0%和5.0%。图4直观的表示视角模糊在不同模态下的性能,其中相同颜色的线表示绘制模态相同。在方法Hybrid中,深度信息用于获取每个点相对于摄像头的距离,最终表示每个物体每个点的三维坐标信息,可以观察到深度信息对视角模糊情况表现不稳定。因此,在多视角行为识别中,RGB+D模态可以弥补从不同视角获得的视觉信息中缺失的点之间的相互距离。本文发现深度信息对于环境的复杂程度很敏感,在不同实验设定下准确率的波动最大可达到20%。通过对数据的观察分析认为,原因可能是深度信息容易受到场景多样性的影响。除了视角模糊问题,视角1中因为摄像头面向门口,在某些视频中出现了多个行人混淆的情况。因此,当场景混乱或存在视角模糊条件时,深度信息的性能将会下降。
图4 对N-UCLA数据集上不同模态的性能评估(Top-1准确率)
通过对图4的观察可以发现在“Test on 5%”情况下RGB模态的方法表现最佳。在方法CAT和DRDN中,明显可以观察到视角之间存在密切的关联。一些在遮挡模糊的行为信息可以通过其他视角找到,并用于补充。为了更有效地区分视角模糊问题和普通的多视角任务,本文选择了探索不同模态的视角不变特征的方法Hybrid、CAT、Glimpse clouds进行讨论。在Hybrid中,通过引入骨骼长度和关节运动限制来提取视角不变特征。通常情况下,基于骨骼的网络引入了额外的模态,可能无法处理现实世界中复杂的环境。方法CAT使用平均解决方案来处理来自每个视角的不同信息,导致预测结果不可靠。而方法Glimpse clouds则倾向于基于3D表示开发视角不变特征,这需要额外的渲染操作。与前述方法不同,视角模糊概念在本文中是首次提出,从视觉角度处理捕捉到的不可靠特征。它可能存在于各种多视角任务中,并不仅仅是行为识别,并且超越了模态的范畴。
技术贡献
本文的主要贡献可归纳如下:1.本文发现存在于多视角行为识别中,由于某个视角模糊产生的信息不均衡的问题。该问题可以进一步拓展到其他多视角、或多模态任务当中。2.本文提出的DRDN在多视角行为识别任务中成功地解决了视角模糊问题,极大地改善了在N-UCLA和NTU-RGB+D 60数据集上的交叉视角和交叉主体识别任务的性能。3.DRDN引入了视角互补的概念,使得网络能够有效地整合不同视角之间的信息差异,从而提升了模型在训练时从多个视角数据中学习更丰富的特征表示的能力。视角互补使得网络可以在训练过程中有效地融合不同视角的数据,从而增强了模型的泛化性能和视角不变性。
详细内容参见
Wenxuan Liu, Xian Zhong, Zhuo Zhou, Kui Jiang, Zheng Wang, Chia-Wen Lin: Dual-Recommendation Disentanglement Network for View Fuzz in Action Recognition. IEEE Trans. Image Process. 32: 2719-2733 (2023)
作者介绍
第一作者刘文璇于2024年6月获得武汉理工大学计算机与人工智能学院博士学位。她的研究方向包括深度学习、行为识别和计算机视觉。成果如下:Dual-Recommendation Disentanglement Network for View Fuzz in Action Recognition. IEEE Transactions on Image Processing, 2023.(第一作者,中科院一区,JCR Q1,CCF A类期刊,IF 10.6)2. Actor-Aware Alignment Network for Action Recognition. IEEE Signal Processing Letters, 2022.(第一作者,中科院二区,JCR Q2,IF 3.911)3. Bi-Causal: Group Activity Recognition via Bidirectional Causality. In Proc. IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2024.(第二作者,CCF A类会议)4. Uncovering the Unseen: Discover Hidden Intentions by Micro-Behavior Graph Reasoning. In Proc. ACM International Conference on Multimedia (ACM MM), 2023.(通讯作者,CCF A类会议)5. Neighborhood Information-Based Label Refinement for Person Re-Identification with Label Noise. In Proc. International Conference on Acoustics, Speech and Signal Processing (ICASSP),2023.(通讯作者,CCF B类会议)6. Background-Weakening Consistency Regularization for Semi-Supervised Video Action Detection. In Proc. International Conference on Acoustics, Speech and Signal Processing (ICASSP),2023.(通讯作者,CCF B类会议)7. Implicit Attention-Based Cross-Modal Collaborative Learning for Action Recognition. In Proc. IEEE International Conference on Image Processing (ICIP),2023. (通讯作者,CCF C类会议)中文论文:一种融合本体与条件随机场的视频语义提取方法 ,武汉大学学报(理学版). 2020.(通讯作者)专利:1. 一种基于Haar-like特征及CNN匹配的视频运动目标识别方法2. 一种基于背景弱化及一致性计算的半监督动作检测方法3. 基于视角和行为解耦的多视角行为识别方法及系统4. 一种基于3D脉冲神经网络的行为识别方法、系统及装置。地方标准:城市隧道监控系统技术规范,DB42/T1952-2023, 湖北省住房和城乡建设厅湖北省市场监督管理局联合发布,2023-01-06,已发布,参与撰写。
钟忺是本文的通讯作者,武汉理工大学计算机与人工智能学院的教授,博士生导师,武汉理工大学信息化办公室副主任(挂职2022-2023),佛罗里达大学、北京大学、南洋理工大学访问学者。任CCF高级会员,CCF YOCSEF武汉AC委员,CCF多媒体技术专委会执行委员,CSIG多媒体专委会和交通视频专委会委员。研究方向为人工智能、多媒体信息处理和神经形态计算,在TIP、TMM、TCSVT、CVPR、ACM MM、AAAI等知名期刊和会议上发表了多篇学术论文。