这篇文章于 2023 年 11 月 1 日发布在 arXiv 上。arXiv 是一个收集物理学、数学、计算机科学等领域预印本论文的平台,许多科研人员会先将研究成果以预印本形式发布在 arXiv 上,以便快速分享研究进展,之后再提交到正式的学术期刊进行同行评审和发表。该论文后续预计发表在《Expert Systems With Applications》期刊 2024 年第 239 卷,论文编号为 122419。
摘要
行人重识别(Re-ID)技术在智能监控系统中发挥着越来越关键的作用。广泛存在的遮挡现象严重影响了行人重识别的性能。遮挡行人重识别是一种应对行人信息丢失、噪声干扰和视角不对齐等挑战的行人匹配方法,它已引起研究人员的广泛关注。在过去几年里,人们提出了几种解决遮挡问题的行人重识别方法,以处理由遮挡引发的各种子问题。然而,目前缺乏全面的研究来详细比较、总结和评估遮挡行人重识别方法的潜力。在这篇综述中,我们首先详细概述了遮挡行人重识别领域中使用的数据集和评估标准。随后,我们对现有的基于深度学习的遮挡行人重识别方法进行了严格的科学分类和分析,从不同角度审视这些方法,并对每种方法进行简要总结。此外,我们对这些方法进行了系统的比较分析,找出了最先进的解决方案,并对遮挡行人重识别研究的未来发展方向提供了见解。
1. 介绍
近年来,随着监控设备的集成化和智能化程度不断提高(贝达卡尔 - 加拉、沙阿,2014年),行人重识别(Re-ID)技术取得了显著进展。这项技术在医学、救援行动、刑事调查和监控等多个领域有着广泛的应用。这些领域通常在复杂多变的环境中运作。因此,在多摄像头遮挡场景下快速、准确地定位和识别特定行人目标具有重大的现实意义。
图1. 综述的整体结构。
表1 近年来行人重识别相关综述的总结在现实生活场景中,人和物体随意移动,这使得行人被遮挡的可能性很高。监控设备通常覆盖范围广泛,这进一步加剧了情况的复杂性。遮挡会显著降低视觉信息的质量,使受影响的特征变得不可靠。这种现象可能由多种因素引起,包括物体的干扰、行人姿势、服装以及视角的变化。
在早期对行人的特征表示中,研究人员主要依赖从图像中提取的基本局部视觉属性,如颜色、纹理、边缘和角点。这些特征能够捕捉图像中的几何形状和像素分布,但对外部因素高度敏感,缺乏鲁棒性和泛化能力。深度学习的发展引入了高级视觉特征。与低级视觉特征相比,高级特征对遮挡、噪声和姿势变化的适应性更强,在复杂环境中具有更强的鲁棒性。因此,众多研究人员开发了大量方法来解决普遍存在的遮挡问题。
一般来说,遮挡问题可分为三个子问题:第一,噪声问题,即在复杂场景采集过程中,特征受到多种混合信息的干扰;第二,缺失问题,即由于只捕捉到行人的部分身体,导致行人特征不完整;第三,对齐问题,由于姿势、视角和位置的变化,特征无法一一对应,从而导致注意力分散、共享位置不对齐等问题。对遮挡问题的研究以将人体从背景中分离出来提取人体特征为核心。同时,研究重点还在于开发能够提取更精细、更具判别力且更具参考价值和本质特征的方法。
我们希望明确现有方法的当前技术水平和局限性,并探索尚未研究的领域。具体而言,我们介绍了2023年之前发表在顶级国际期刊或会议上的处理遮挡行人重识别的方法。我们根据提取特征的网络结构(基于卷积神经网络、基于Transformer以及基于混合结构)、特征提取方式(单模态和多模态)以及特征的层次结构(2D和3D),对基于深度学习的遮挡行人重识别方法进行分类(见图1)。首先,由于卷积神经网络(CNN)在图像匹配任务中表现出色,基于CNN的方法已成为解决行人重识别中遮挡问题的主流方法。因此,我们将基于CNN的方法归为解决遮挡问题的第一类方法。其次,随着Transformer在自然语言处理领域取得成功,视觉Transformer(ViT)在处理行人重识别中的遮挡问题方面也得到了广泛应用,并取得了良好的效果。因此,我们将基于Transformer的方法归为第二类。第三类方法是复合方法,例如利用CNN和ViT的互补性创建混合结构。第四类和第五类方法分别是利用3D和多模态方法来解决行人重识别中的遮挡问题。这些方法能够处理更广泛的场景,代表了一种相对新颖的方法。
总体而言,本研究的贡献如下:
- 本研究专注于解决行人重识别模型中的遮挡问题,这对于实现高精度和强鲁棒性至关重要。我们对过去和当前的前沿方法进行了科学且全面的综述。
- 目前对行人重识别方法的综述对基于视觉Transformer(ViT)的方法覆盖不足。鉴于ViT在遮挡行人重识别中表现出色,我们在研究中对该方法及其混合变体进行了讨论,为研究人员解决遮挡问题提供了新思路和选择。
- 我们创造性地纳入了近年来备受关注的3D行人重识别和多模态行人重识别。这些新颖的方法通过利用额外的深度或模态信息,能够更好地解决遮挡问题,从而提高行人重识别的性能和可靠性。
- 我们期待遮挡行人重识别领域不断取得进展,并坚信持续的研究和创新将产生更有效的方法和技术来应对遮挡问题。这些进展有望为更广泛的行人重识别领域提供灵感,推动该领域的发展。
2. 文献综述
在行人重识别领域,与方法学文章相比,专门的综述相对较少。现有综述主要聚焦该领域的特定方面,相关情况总结在表1中。例如,Bedagkar - Gala和Shah(2014)深入探讨行人重识别面临的挑战,依据图库的固定性将其分为开放集重识别和封闭集重识别。Zheng等人(2016)则基于匹配策略,把行人重识别方法分为图像相关和视频相关两类。Gou等人(2018)进行了更细致的研究,对行人重识别相关的特征、度量标准和数据集展开深入探讨。Wang、Wang、Wu等人(2019)专注于异构行人重识别,根据应用场景将方法划分为低分辨率、红外、草图和文本四类。
其他综述研究包括:Leng等人(2019)专注于开放世界的重识别任务;Lavi等人(2020)依据特征学习策略,将重识别分为基于单特征学习和多特征学习的方法。Ye、Shen等人(2021)对开放和封闭场景下的重识别进行了全面阐释,介绍了跨膜状态和无监督方法等。Yaghoubi等人(2021)对行人重识别问题进行了多维分类;Ming等人(2022)基于度量学习和表征学习,把行人重识别方法分为四类,还纳入了最新的方法。Peng等人(2022)则聚焦于基于图像的遮挡行人重识别方法。
这些研究不可避免地受到某些固有局限性的制约。鉴于行人识别中遮挡问题普遍存在,对遮挡行人重识别的研究至关重要。因此,我们对遮挡行人重识别领域的方法和未来前景进行了全面总结和综合分析,旨在推动该领域未来的发展。
3. 数据集和评估协议
3.1. 数据集
图2. 四种常用遮挡行人重识别数据集示例。遮挡行人重识别数据集可分为两类:部分行人数据集和遮挡行人重识别数据集。遮挡行人重识别数据集的行人图像存在遮挡信息干扰,且未经过裁剪。部分行人重识别数据集中行人图像部分是存在的,并且是经过人工裁剪的。部分/遮挡行人重识别数据集的示例如图2所示。
Occluded-DukeMTMC(苗、吴、刘、丁和杨,2019年)是从DukeMTMC-reID(郑、郑、杨,2017年)中收集而来,包含708名行人的15618张训练图像、519名行人的2210张查询图像,以及1110名行人的17661张用于测试的图库图像。在这些图像中,训练集的9%、查询集的100%以及图库的10%为遮挡图像。遮挡物包括汽车、自行车、树木和其他行人,这增加了数据集的复杂性。
P-ETHZ(郑、李等人,2015年)是一个基于图像的遮挡行人重识别数据集,由ETHZ(埃斯、莱贝、辛德勒和范古尔,2008年)修改而来。它有3897张图像,包含85个行人身份,每个身份有1到30张全身和遮挡的行人图像。
P-DukeMTMC-reID(卓、陈、赖和王,2018年)是对DukeMTMC-reID(郑等人,2017年)进行修改得到的,总共包含1299名行人的24143张图像,每个身份都有全身和遮挡图像;图像中的行人被不同物体遮挡,如其他行人、汽车和标识牌。
Occluded-REID(郑、李等人,2015年)有200名行人的2000张图像,每个行人对应5张遮挡图像和5张全身图像,该数据集是从中山大学收集的。该数据集包含不同的视角和严重的遮挡类型,这对行人重识别构成了挑战。
Occluded - DukeMTMC - VideoReID(Hou等人,2021年)是由DukeMTMC - VideoReID(Wu等人,2018年)数据集重新整理而来。其训练集包含1702个轨迹片段,涵盖702名行人;测试集的查询涉及661名行人;图库涵盖1110名行人。超过70%的视频存在遮挡情况,其中包含不同的视角,以及汽车、树木、自行车和其他行人等各种各样的遮挡物。
Partial - ReID(郑、李等人,2015年)包含60名行人的600张图像,每个行人有5张部分图像和5张全身图像。利用可见部分,手动裁剪形成新的部分图像。这些图像是从大学校园的不同视角、背景和遮挡情况下收集而来的。
Partial - iLIDS(何、梁、李和孙,2018年)源自iLIDS(郑、龚和向,2011年),包含119名行人的238张图像。每个行人对应一张手动裁剪的非遮挡部分图像和一张全身图像。部分图像用作查询,全身图像用作搜索库。它由多个不重叠的摄像头拍摄,主要用于测试集。
Partial - CAVIAR(何等人,2018年)源自CAVIAR(程、克里斯塔尼、斯托帕、巴扎尼和穆里诺,2011年),包含72名行人的142张图像。部分图是通过随机选取每个行人整体图像的一半生成的。
P - CUHK03(金和柳,2017年)是基于CUHK03(李、赵、肖和王,2014年)构建的,总共有1360张行人图像,其中1160名行人对应的15080张图像用作训练集,其余100名行人用作验证集和测试集。从其中两张图像中选取生成10个具有空间面积比的局部身体查询图像,其余三张图像用作全身图库图像。
3.2. 评估协议
在遮挡行人重识别领域,常用的评估指标是累积匹配特性(CMC)曲线和平均精度均值(mAP)。
行人重识别领域基本都用的这两个评估协议
CMC曲线基于对查询图像和图像库之间的相似度进行排序的原理,排在越靠前位置的图像,与查询图像的相似度越高。然后,基于这个排序计算查询图像的前k准确率。如果前k个样本中包含查询目标,那么为1, ;否则,为0。最后,将所有目标的曲线相加,再除以目标总数,从而得到CMC-k。
平均精度均值(mAP)能更好地反映所有正确目标图像在排序列表顶端的定位程度。与累积匹配特性(CMC)曲线相比,mAP对行人重识别(ReID)算法的性能提供了更全面的评估。这里,“P”代表精度,即正确样本在所有样本中所占的比例,它反映了模型输出对于正确样本的准确程度。平均精度(AP)是模型预测的所有正确样本的平均值,通过对每次正确预测的精度求平均,表明模型在特定类别中的运行效果。鉴于识别任务中存在多个类别,mAP通过计算所有类别的平均AP值获得,即将每个类别的平均精度相加,再除以类别总数得到mAP。
累积匹配特性(CMC)曲线无法考虑排名较低的样本的命中情况,而平均精度均值(mAP)会考虑所有样本。因此,它们都很重要且具有互补性。
4. 深度学习方法
4.1. 基于卷积神经网络(CNN)
卷积神经网络(CNNs)已成为从RGB图像中学习行人表征的主要方法之一。通过利用局部感知域并学习滤波器,卷积神经网络能够提取强大的特征,这些特征可捕获有关行人局部特征的区域信息。然后,这些特征会被压缩并映射为更高级别的表征。研究人员对其进行了优化,使其适用于复杂现实场景中的行人匹配任务。我们将其分为局部特征学习、关系表征、混合方法以及其他方法。
4.1.1. 局部特征学习
图3. 四种不同的局部特征学习方法:(a)表示姿态估计,(b)表示语义分割,(c)表示属性标注,(d)表示混合方法。局部特征学习在捕捉区域特征方面表现出色,与全局特征相比,它在识别和定位被遮挡区域方面具有显著优势。根据所采用的不同局部特征方法的实现方式,我们将其分为人体分割、姿态估计、人体解析、属性标注以及混合方法(见图3)。
人体分割。利用行人直立行走的特点,我们的方法通过对原始图像或特征图进行分割来提取经过改进的局部特征。分割结果可以呈现为条纹状、固定区域或小块状(见图4)。然而,分割过程不包含识别遮挡的环节,因此它对噪声较为敏感。
就是从上往下把识别出来的人体图进行切割成一部分一部分的,然后分别对每个部分进行特征提取。
为应对这些挑战,研究人员开发出了多种方法。例如,CBDB - Net(谭、刘、卞、王和尹,2021年)将特征图上的条带均匀划分。然后系统地逐个丢弃每个条带,以生成多个不完整的特征图。这种方法迫使模型即使在信息不完整的环境中也能学习到更稳健的行人表征。DPPR(金和柳,2017年)为全身图像预定义了十三个边界框,包括全身图像、半身图像和水平部分图像,并从每个部分提取特征。同时,它引入了基于注意力的匹配机制,为同一身体部位的特征赋予更高的权重,从而减轻由遮挡导致的信息损失的影响。OCNet(金、赵、李、赵和李,2022年)采用基于关系的方法来处理遮挡问题。它将图像水平划分为顶部、中部和底部三个部分,并提取相应的四个特征。它使用具有两个共享层的关系自适应模块来解决区域特征之间的对齐问题,同时引入权重以减少噪声干扰。
姿态估计。姿态估计通过利用结构化的人体骨骼来提取图像姿态层面的语义信息。通过引导或融合技术来减轻噪声干扰。以HOReID(王、杨等人,2020年)为例,它引入了一个可学习的关系矩阵。从姿态估计中获得的关键人体关键点被视为图中的节点,从而形成拓扑图,以进一步抑制噪声干扰。PMFB(苗、吴和杨,2021年)使用姿态估计来获取人体关键点的置信度和坐标。然后,设置一个阈值来过滤被遮挡的区域。最后,利用可见部分在通道层面上约束特征响应,以解决遮挡问题。PGMANet(翟、韩、马、苟和肖,2021年)利用人体热图生成注意力掩码。通过特征图的点积和高阶关系的引导,共同消除噪声干扰。
姿态估计主要是检测图像中人物(或物体)的关键点(如关节、面部特征点等),并推断其姿态(如站立、坐姿、动作等)。就是上述图中的(a),用原始图像生成人体拓扑图(人体拓扑图能够提供人体结构信息,减小噪声),之后相当于进行多模态融合。
研究人员通常在两个关键方向上运用姿态估计。其一,用于提取语义特征,从而能够识别噪声点,并提升对噪声干扰的消除能力。其二,利用姿态估计对人体区域进行定位,这有助于解决对齐问题,并有利于局部特征的提取。AACN(徐、赵、朱、王和欧阳,2018年)利用姿态点来定位行人的身体区域,并引入姿势引导的可见性分数来分离遮挡部分。DAReID(徐、赵和秦,2021年)采用了双分支结构。在这种架构中,掩码分支负责在姿态估计的引导下,利用空间注意力模块提取具有高判别性的局部特征。与此同时,全局分支通过特征激活来增强对人体判别信息的表征。
语义分割。通过整合人体解析模型,利用分割或语义解析来检测并消除噪声干扰。以SPReID(卡莱耶、巴萨兰、格克门、卡马萨克和沙阿,2018年)为例,它基于训练好的行人类别语义解析模型Inception-V3(塞吉迪、万霍克、伊奥菲、施伦斯和沃伊纳,2016年)生成与五个不同身体区域相关的概率图,即前景、头部、上半身、下半身和鞋子。随后,这些概率图在双线性插值后与语义区域特征进行融合。这种融合过程激活了不同的身体部位,并有效地减轻了遮挡的影响。协同注意力模型(林和王,2021年)将行人局部身体图像的解析掩码用作查询,并同时构建映射。该过程引入了一种自注意力机制,旨在滤除遮挡部分。MMGA(蔡、王和程,2019年)首先利用JPPNet(梁、龚、沈和林,2018年)将图像中的行人分为上半身和下半身片段。随后,该方法引入了两个注意力模块。第一个模块用于滤除背景干扰,而第二个模块则基于全身、上半身和下半身掩码生成空间和通道注意力。最终,通过元素级乘法生成最终特征。HPNet(黄、陈和黄,2020年)利用COCO(林等人,2014年)数据集来训练人体解析模型。该模型为四个主要身体部位提供标签,这些标签以多任务方式同时用于训练解析模型和整个网络。此外,该过程还包括生成可见性分数以减轻遮挡的影响。
语义分割主要是将图像中的每个像素分类到预定义的类别中(如人、车、背景等),但不区分同一类别的不同实例。例如,所有的人会被标记为同一颜色或类别 ID。就是图中的(b),通过语义分割识别出人体的各个部分,来学习人体结构信息以及减小噪声的影响。
基于语义分割的方法为增加特征多样性做出了重大贡献。这些方法将图像划分为不同的区域,使模型能够仔细审查并理解每个特定部分的上下文。这反过来又有助于进行更详细的场景分析,从而产生更丰富、更多样化的特征表示。以SORN(张、严、薛、华和王,2020年)为例,采用了一个三分支模型,包括全局分支、局部分支和语义分支。全局分支的任务是通过归一化和特征聚合来获取全局特征。与此同时,局部分支利用行人身体结构的先验知识来生成行人身体部位,并通过映射、池化和归一化过程提取局部特征。语义分支首先使用DANet(傅等人,2019年)模型对数据进行语义标签的预训练。随后,在DensePose-COCO数据集(居勒、内韦罗娃和科基诺斯,2018年)上训练一个语义分割模型,并结合标签平滑来优化语义标签。最后,聚合语义分割组件。这种聚合过程生成了前景行人身体区域,有效地实现了背景与行人的分离。
属性标注。通过引入属性标注来处理遮挡问题。ASAN(金、赖和钱,2021年)通过结合属性信息和弱监督来提取人体特征的可见部分。属性信息是一种语义层面的属性标注。基于可见部分的判定,引入区域可见性匹配算法以达到去噪的效果。
混合方法。引入两种以上的外部信息可以通过特征交互或协同引导的形式帮助模型消除噪声干扰。GASM(何和刘,2020年)引入了一种用于学习显著信息的架构。首先,它利用语义信息将行人与背景分离。然后,通过姿态估计来处理遮挡干扰。最后,融合这两种特征以引导模型学习。SSPReID(奎斯佩和佩德里尼,2019年)设计了一种联合学习方法,将显著特征和语义特征相结合。通过人体解析获得人体的五种不同语义特征。显著特征利用图中关注度最高的区域。将这些特征与全局特征融合,最后连接在一起形成最终的特征。TSA(高、张等人,2020年)提出了两种特征来解决姿态变化问题。一组由姿态关键点引导,另一组由人体解析模型生成的局部掩码引导。随后将这两组特征进行融合。利用交互可以有效地解决姿态变化问题,姿态与分割的结合有助于抑制噪声,从而解决遮挡问题。FGSA(周等人,2020年)提出了一种针对复杂姿态变化的姿态解析网络,用于处理局部位置及其之间的关系。
4.1.2. 关系表征
图5. (a)图卷积示意图。(b)聚类的示意图。(c)共享区域的示意图。通过强调特征之间的关系,可以通过抑制、消除或监督的方式来处理遮挡问题。根据所采用的不同方法和机制来学习这些关系,我们将这些方法分为四类:注意力机制、聚类方法、图卷积方法以及共享区域方法(如图5所示)。
注意力机制。通过引入注意力机制,模型能够选择高度显著且具有判别性的区域,从而抑制噪声干扰。为了解决行人重识别中图像缺失的问题,DPPR(金和柳,2017年)采用注意力机制来突出不同图像中行人的相同身体部位。此外,OCNet(金等人,2022年)通过捕捉区域特征之间的高阶关系并将其与加权组合相结合,减轻了噪声的影响。这种方法有效地抑制了噪声或无关信息的影响,从而产生了更稳健、准确的行人重识别结果。DAReID(徐等人,2021年)引入了双重注意力识别。通过手势引导的空间注意力获取行人可见的局部区域。通过特征激活和姿态提取全局特征。然后将两者结合起来引导特征的表示。MHSA-Net(谭、刘、尹和李,2022年)将注意力权重与特征图相乘,并应用非线性变换,以促使多头注意力机制自适应地捕捉关键的局部特征。
通过融入注意力机制,模型能够将更多注意力分配给重要特征,并忽略无关特征。这不仅使模型能够根据不同输入调整其注意力分配,从而提高了模型的灵活性,而且由于模型突出了输入中的相关部分,还增强了其可解释性。PAFM(杨、张、唐和李,2022年)引入了一个增强型空间注意力模块,旨在发现像素点之间的关系,同时捕捉和聚合具有高度语义相关性的像素点。随后,该模块与包含姿态信息的特征图相乘,以进行特征融合。协同注意力模型(林和王,2021年)将部分行人图像的解析掩码和完整图像作为目标,利用自注意力机制(李、江和黄,2020年)对它们进行匹配。其结果是通过聚焦于行人特征来抑制噪声干扰。
聚类。通过识别数据的内在分布结构对像素点进行分类,从而解决噪声干扰问题。ISP(朱、郭、刘、唐和王,2020年)通过串联聚类为每个像素分配一个伪标签。基于前景比背景响应更强的假设,首先将人体图像的所有像素分为前景和背景。其次,将像素聚类成不同的部分并分配伪标签。基于这些伪标签,为像素分配不同的权重以提取局部特征。这不仅在像素层面上将遮挡部分与行人区分开来,还实现了自动对齐。
通过聚类打伪标签是无监督行人重识别中常用的操作。
图卷积。学习高阶语义像素关系,通过约束信息传递来抑制噪声干扰。HOReID(王、杨等人,2020年)引入了一个描述点之间高阶关系的矩阵,随后在这个关系矩阵中传递信息以形成拓扑图。借助拓扑图的约束,抑制了点之间无用信息的传递,达到了去噪的目的。
共享区域。通过感知图像对中行人的相同身体部位来提取可共享特征,从而减轻噪声干扰。DPPR(金和柳,2017年)为包含匹配身体部位的区域赋予更大的权重,增强了模型提取关键特征的能力。VPM(孙等人,2019年)通过感知共享区域的可见性来应对对齐和去噪方面的挑战。PPCL(何、沈、黄、陈和华,2021年)自主学习部件匹配,并最终仅基于共享语义对应区域来计算图像相似度。KBFM(韩、高和桑,2020年)专注于提取高度可见且可共享的姿态点,将其作为特征提取的核心区域,从而达到去噪和对齐的效果。
4.1.3. 其他方法
区域重构。这种方法利用行人完整的区域来补充被遮挡或存在噪声的区域。为了解决因遮挡导致的信息丢失问题,RFCNet(侯等人,2021年)引入了一种编码器-解码器架构,该架构利用未被遮挡的远距离空间上下文来完成特征的补全。编码器是基于相似区域分配来设计的,而解码器则通过聚类建立被遮挡区域与远距离未被遮挡区域之间的关联,从而对被遮挡区域进行重构。ACSAP(何、杨和陈,2021年)结合了姿态和对抗生成网络,引入了姿态引导的空间生成器和空间判别器来消除噪声干扰。
数据增强。通过纳入数据变换技术,增强了模型对遮挡的敏感度。IGOAS(赵等人,2021年)采用了渐进式遮挡模块,在一组图像上引入小的均匀遮挡,并根据模型学习逐步生成更大的遮挡。这种方法提高了对遮挡的识别能力。OAMN(陈、刘等人,2021年)使用了裁剪和缩放方法,预先定义四个角,并随机选择一张训练图像,将其裁剪并缩放到四个位置的图像块。结合注意力机制的加权学习实现了去噪。SSGR(严等人,2021年)引入了复合批量擦除方法,包括随机擦除和批量常量擦除操作。它将图像划分为随机片段,有选择地擦除每个子批量中的条带,并采用基于匹配的解耦非局部操作,增强了从完整行人区域提取特征的能力。ETNDNet(董、张、严、唐和唐,2023年)从对抗防御的角度解决遮挡问题。它通过随机擦除特征图、引入随机变换以及扰动特征图来处理不完整信息、位置不对齐和噪声数据。
正则化。利用惩罚和约束来针对高关注度区域,迫使模型优先考虑整个行人区域。这种方法确保利用全面的信息来提取行人特征。MHSA-Net(谭、刘等人,2022年)引入了一种特征正则化机制,该机制由两部分组成:基于注意力权重嵌入的正则化项,以及基于三元组特征单元的难例三元组损失。正则化项使局部信息表示多样化,并提高信息的完整性。同时,难例三元组损失对特征融合进行优化,从而提升行人匹配效果。
师生模型。教师模型帮助学生模型处理遮挡问题。HG(基兰等人,2021年)设计了一个端到端的无监督师生框架,教师网络通过输入不同的图像组合来学习类间距离,然后学生网络继承该网络,并通过输入更多同一类别的含噪图像来学习类内距离。同时,采用距离分布匹配的注意力嵌入方法可以帮助学生网络更好地消除噪声干扰,并提取更具判别性的特征。AFPB(卓、赖和陈,2019年)采用两步法来应对遮挡挑战。首先,将常规数据和模拟遮挡的行人体积数据纳入教师网络。随后,通过联合训练过程,教师网络能够获得一个能够处理遮挡的稳健模型。然后,学生网络从教师网络中继承知识,并通过学习更真实且含噪的现实世界中被遮挡的行人数据来进一步提升其能力。
多尺度。通过多尺度特征表示方法可以有效地解决遮挡问题。DSR(贺等人,2018年)专注于通过训练固定大小的全卷积网络并引入三种不同尺度的模块来提取特征,以解决尺度差异问题。同样,FPR(贺等人,2019年)使用由卷积层和池化层组成的结构来处理尺度问题。它引入了具有各种池化核的金字塔层,并采用基于注意力机制的前景概率生成器来减少背景干扰。
4.2. 基于视觉Transformer(ViT)
图6. (a)基于Transformer方法的示意图。(b)示意性表示数据增强方面的内容。2021年提出的TransReID(贺、罗等人,2021年)是一个重要的里程碑,它是首个将视觉Transformer(ViT)架构(多索维茨基等人,2020年)应用于行人重识别(Re-ID)领域的模型(见图6)。与残差网络(ResNet,贺、张、任和孙,2016年)相比,TransReID有两个关键优势:(1)TransReID利用多头自注意力机制,能够出色地捕捉数据中的长距离依赖关系。这一特性促使模型专注于不同的身体部位(汗等人,2022年;沙姆沙德等人,2023年),增强了其有效区分不同个体的能力。(2)TransReID所采用的Transformer架构即使在不进行下采样计算的情况下,也擅长保留复杂的细节。这种能力使得数据能够得到更丰富且信息更充足的表征。
基于这些特点,近年来出现了许多Transformer的变体,研究人员也广泛地将它们应用于遮挡情况下的行人重识别中。PFD(王、刘等人,2022年)使用Transformer来捕捉图像块之间的上下文关系,并通过姿态引导的特征聚合来增强身体部位的可见性。PFT(赵、朱、王和梁,2022年)引入了一种可学习的增强补丁,通过Transformer来改进局部特征提取,同时关注局部和长距离的相关性。FED(王、朱等人,2022年)区分了不同类型的遮挡,并专注于非目标行人造成的遮挡。FRT(徐、何、梁和孙,2022年)将行人分为头部、躯干和腿部,然后采用基于图的遮挡消除模块,通过学习区域相似性来减少遮挡的影响。
4.3. 组合方法
通过引入两种以上不同的网络,以交互或融合的方式来处理遮挡问题。FGMFN(张、陈、陈、张和郑,2022年)采用了双分支网络,局部特征经过仿射变换,并由残差网络-50(ResNet-50)进行处理以提取上半身特征。借助注意力模块,这些特征被划分为三个区域,同时利用分块方案提取全局特征。最终的特征是两个分支的融合。Pirt(马、赵和李,2021年)在COCO数据集上对HRNet姿态估计模型进行预训练,然后采用双分支结构。部分内特征由改进的残差网络-50(ResNet-50)进行处理,而部分间的关系则由Transformer引导。该模型通过建立部分感知的长距离依赖关系,有效地处理了遮挡问题。DRL-Net(贾、程、陆和张,2022年)从训练图像中生成带有随机障碍物的增强样本。它结合了卷积神经网络(CNN)和Transformer来创建基于查询的语义特征提取层,并使用语义引导来学习正负样本的比较,有效地消除了干扰噪声。
4.4. 三维行人重识别(3D行人重识别)
与传统的二维方法相比,在遮挡行人重识别中利用三维信息是一项相对较新的发展。三维数据提供了稳健的形状和空间深度特征,这些特征受纹理信息的影响较小,从而能有效减少遮挡带来的干扰。这是通过三维特征去噪、三维特征补全和多视图构建等技术来实现的。例如,PersonX(孙和郑,2019年)通过扫描现实世界中的人和物体来创建虚拟三维模型,然后将其转换回二维表示形式。这种数据处理方式增强了数据的表征能力。在另一种方法中,王、梁和廖(2022年)采用UV纹理映射,将现实世界中行人的衣物转移到虚拟的三维角色上。他们利用基于面片的特征分割和扩展方法来应对遮挡挑战。三维信息的一种更为常见的形式是点云(齐、苏、莫和吉巴斯,2017年),其中点云的深度信息可以作为图像的额外通道。OGNet(郑、王、郑和杨,2022年)使用蒙皮多人线性模型(SMPL,卡纳扎瓦、布莱克、雅各布斯和马利克,2018年)从二维图像生成六通道的点云数据,提供位置和纹理信息。ASSP(陈、江等人,2021年)将三维人体重建作为二维特征提取的辅助任务。
然而,与二维图像相比,利用点云进行识别的研究仍然有限,这是未来的一个重要研究方向。
4.5. 多模态行人重识别
RGB-红外多模态行人重识别。白天和夜晚都是行人活动的重要场景,在光照不足的情况下,只能通过红外摄像机采集图像(阮、洪、金和朴,2017年;吴、郑、于、龚和赖,2017年)。如果场景中存在遮挡情况,红外图像中同样会有遮挡现象。同时,红外图像可以作为RGB图像的一种特殊通道,这使得RGB图像的表征模式更加完整,并且能够在因遮挡导致信息缺失的情况下很好地补充信息。
RGB-红外多模态行人重识别旨在将红外图像和常规图像都输入到模型中。通过不同模态之间的关系,或者结合注意力机制等方法来处理单模态噪声、多尺度等问题,从而实现对遮挡干扰的去除。DDAG(叶、沈、J. 克兰德尔、邵和罗,2020年)提出了一种动态双注意力跨模态图结构。它首先基于特征相似度生成局部注意力。然后,引入一种聚合表示用于部件级关系学习。此外,它结合了图结构,通过关系信息来去除噪声干扰。为了解决模态内的挑战,HMML(张等人,2022年)引入了基于配对的模态内相似性约束来增强特征。同样,CMC(温、冯、李和陈,2022年)采用多尺度、多层次的特征学习来进行精细化的特征提取。为了解决图像内部不对齐的问题,DTRM(叶、陈、沈和邵,2021年)结合了注意力和部分聚合的方法。它利用两种模态之间的上下文关系来增强全局特征,并减轻噪声的影响。
RGB-深度多模态行人重识别。深度图像是通过激光雷达等设备获取的,它通过测量距离提供了有价值的人体形状和骨骼信息。在常规图像中信息被障碍物遮挡的情况下,深度特征可以补充基于纹理的位置信息,提供更全面的表征。此外,深度特征可以应对与光照变化和服装变化相关的挑战,这些变化会影响行人识别。事实证明,深度特征在处理与障碍物相关的光照变化以及因不同环境导致的服装变化等问题时特别有用。CMD(哈夫纳、布伊安、库伊伊和格兰杰,2022年)提出了一种结合嵌入表示和特征蒸馏的方法来处理噪声干扰。这种方法采用门控注意力机制,通过对来自另一种模态的信号进行门控,动态激活一种模态中更具判别性的特征,有效地降低了噪声的影响。
RGB-文本多模态行人重识别。RGB-文本多模态行人重识别旨在引入文本数据,通过共享语义信息和注意力校准来增强特征表示,以消除噪声的影响。在日常生活中,文本信息是最常用的信息类型之一。当图像信息因障碍物而缺失或无法使用时,可以用文本信息来补充。AXM网络(法鲁克、阿瓦斯、基特勒和哈立德,2022年)动态地利用文本和图像的多尺度信息,根据共享的语义对每种模态进行重新校准,并在文本分支中添加上下文注意力,以补充卷积模块的信息。此外,引入注意力机制来增强视觉部分的特征一致性和局部信息。它能够学习不同模态的对齐语义信息,并自动消除无关信息的干扰。
5. 方法对比
表2 基于局部特征学习方法的实验结果对比。红色数字表示最佳结果。(以百分比计)
表3 基于关系表示方法的实验结果对比。红色数字表示最佳结果。(以百分比计)
表4 其他方法的实验结果对比。红色数字表示最佳结果。(以百分比计)我们在两个通用数据集(Market1501 郑、沈等人,2015年;DukeMTMC-reID 里斯塔尼、索莱拉、邹、库奇亚拉和托马西,2016年)、两个遮挡行人重识别数据集(Occluded-DukeMTMC 苗等人,2019年;Occluded-REID 郑、李等人,2015年)以及两个部分行人重识别数据集(Partial-ReID 郑、李等人,2015年;Partial-iLIDS 贺等人,2018年)上对遮挡行人重识别方法的结果进行了统计评估。我们将这些方法分为三类:基于局部特征学习方法的实验结果见表2。这一类方法包括人体分割、姿态估计、语义分割、属性标注以及融合方法。基于关系表示方法的实验结果见表3。这一类方法包括共享区域、聚类、图卷积以及基于注意力机制的方法。其他方法的实验结果见表4,其中包括基于Transformer的方法、组合方法、多尺度方法、数据增强以及正则化技术。关于每个方法类别的详细介绍以及各项研究的具体内容,请参考第4节。从这些结果中,我们可以得出以下几点认识:
(1)从结果中我们可以得到以下信息:基于局部特征学习的OCNet(金等人,2022年)、基于关系表示的QPM(王、丁等人,2022年)、基于Transformer的DPM(谭、戴等人,2022年)和PFD(王、刘等人,2022年)在Occluded-DukeMTMC数据集上表现更好。在Occluded-REID数据集上,基于局部特征学习的HPNet(黄等人,2020年)、基于关系表示的HOReID(王、杨等人,2020年)、基于Transformer的FED(王、朱等人,2022年)和PFD(王、刘等人,2022年)表现稳定。在Partial-ReID数据集上,基于局部特征学习的ASAN(金等人,2021年)和LKWS(杨等人,2021年)、基于关系表示的MHSA-Net(谭、刘等人,2022年)以及基于Transformer的FRT(徐等人,2022年)取得了更好的性能。在Partial-iLIDS数据集上,基于局部特征学习的ASAN(金等人,2021年)、基于关系表示的MHSA-Net(谭、刘等人,2022年)和QPM(王、丁等人,2022年)、基于区域重建的ACSAP(何、杨和陈,2021年)以及基于数据增强的OAMN(陈、刘等人,2021年)实现了非常稳定的性能。因此,没有单一的方法能在所有数据集上都取得最佳性能。
(2)总体而言,在遮挡数据集上的性能反映了模型抵抗噪声的能力,在部分行人数据集上的性能反映了模型在行人信息缺失情况下的识别能力,而在通用数据集上的性能则反映了模型的综合表现。这些方法中的每一种都解决了一个或多个特定的问题。
(3) 在众多用于处理遮挡问题的行人重识别方法中,注意力机制和姿态估计是较为主流且典型的方法。另一方面,基于属性标注、基于聚类以及基于图卷积的方法受到的关注则较少。
6. 未来发展方向
6.1. 更丰富、更高质量的数据集
虽然大多数模型是使用在受控环境中收集的数据集进行评估,但必须认识到,在现实场景中存在一些不可控的变量,这些变量会深刻影响模型在这种场景下的性能。对于专注于遮挡行人重识别(Re-ID)的数据集而言,纳入一种或多种模态输入势在必行。这应涵盖一系列多样化的数据类型,包括图像、文本信息、红外数据和深度图。这种多方面的方法使模型能够熟练应对更广泛的现实遮挡挑战。此外,该领域的一个紧迫问题是缺乏广泛的数据集,这些数据集需要跨越更广泛的领域,涵盖不同的环境条件(苟等人,2018),并且具备更高的分辨率。此类数据集的可获取性将有助于为研究人员的调查提供更丰富、更多样化的内容以及更高质量的数据。
6.2. 更强大且更多样化的特征提取
三维行人重识别。受人类三维认知的启发,一些研究人员主张采用结合三维和二维模态的整体行人表征方法(郑等人,2022 年)。目前,PointNet(齐等人,2017 年)作为一种用于点云特征提取的重要深度学习方法(C.S., H., X., S.W., 及 W.J., 2022 年;王、宁等人,2022 年),已展现出了良好的效果。融入点云补全(费等人,2022 年)和点云校正等技术,有助于解决三维遮挡行人重识别中的挑战。此外,利用三维姿态估计(王等人,2021 年)和三维语义分割(谢、田和朱,2020 年)能够指导行人重识别中的特征提取过程。尽管如此,与二维方法所取得的进展相比,三维领域中行人识别方面的研究(孙等人,2019 年;赵、欧阳和王,2013 年)仍然相对有限。因此,三维遮挡行人重识别是未来一个重要且具有前景的研究方向(蒂尔科莱、戈利和韦伯,2020 年)。
多模态行人重识别。从不同模态捕获的信息在内容表示上展现出了显著的多样性(吴、郑、赖,2017;吴、郑、于等人,2017)。在数据和特征提取阶段,改进更全面的行人特征的交互、融合与提取,是未来发展的一个关键研究方向(塞哈尔、纳加拉朱、于,2017;图托伊、坦里库卢,2022)。
跨分辨率遮挡行人重识别。由于采集设备的距离和像素大小的影响,采集样本的分辨率不均匀,特征空间的对应关系也不一致(李、陈、林、杜、王,2019)。同时,低分辨率会导致重要的空间和细节信息丢失(毛、张、杨,2019)。如何在遮挡条件下提取不同分辨率的行人特征,是未来需要解决的一个问题。
无监督和半监督遮挡行人重识别。省略了复杂的人工标注过程,通过使用无标注(刘、查、洪、王、张,2019;张、陆,2018)或少量标注(纳加拉朱、拉朱、科、于,2016;王、王、郑、创、佐藤,2019;王、张等人,2019)的数据集来学习行人特征。目前,在遮挡行人重识别领域,无监督和半监督方法的性能与有监督方法相比仍有不足。有监督技术通常依赖大量的标注数据集进行训练,从而取得较高的性能。然而,随着无监督和半监督方法受到越来越多的关注,它们在提升遮挡行人重识别模型的泛化能力方面展现出了巨大的潜力。
6.3. 遮挡行人重识别系统
目前,很少有研究人员将目标检测与遮挡行人重识别结合起来。端到端的行人重识别系统较为匮乏,而集成系统在现实生活中有更多的应用(马蒂内尔、达斯、米凯洛尼和罗伊 - 乔杜里,2016)。如何更有效、合理地将二者结合起来,以及设计出对遮挡更具鲁棒性的遮挡行人重识别系统,是一个重要的研究方向。
7. 结论
这篇综述对用于遮挡行人重识别的深度学习方法进行了全面且综合的分析与讨论,兼顾了实际应用和研究驱动的需求。首先,我们概述了遮挡问题,并突出介绍了专门为遮挡行人重识别设计的数据集。其次,我们系统地对截至2023年在顶级国际期刊和会议上提出的用于应对遮挡行人重识别挑战的方法进行分类和介绍。最后,我们分别从数据、特征和系统的角度分析了遮挡行人重识别的未来前景。在本研究中,我们将最重要的图像特征提取方法分为五大类:局部特征学习、关系表示、基于Transformer的方法、混合方法以及其他方法。这篇综述旨在帮助研究人员理解这些方法的原理和目标,提供有价值的参考,并对推动遮挡行人重识别研究的意义做出贡献。