该论文《Unsupervised Visible-Infrared Person Re-Identification via Progressive Graph Matching and Alternate Learning》发布于 2023 年,发表在计算机视觉领域顶级会议 IEEE/CVF Conference on Computer Vision and Pattern Recognition(CVPR)的会议论文集中 。
代码地址:https://github.com/zesenwu23/USL-VI-ReID
摘要
由于模态差距大且缺乏跨模态对应关系,无监督可见光 - 红外行人重识别是一项具有挑战性的任务。跨模态对应关系对于弥合模态差距至关重要。一些现有工作试图挖掘跨模态对应关系,但它们仅关注局部信息,没有充分利用不同身份之间的全局关系,从而限制了挖掘出的对应关系的质量。更糟糕的是,两种模态的聚类数量往往不一致,加剧了生成的对应关系的不可靠性。为此,我们设计了一种渐进图匹配方法,以在聚类不平衡的场景下全局挖掘跨模态对应关系。渐进图匹配方法(PGM)将对应关系挖掘表述为一个图匹配过程,通过最小化全局匹配成本来考虑全局信息,其中匹配成本衡量聚类之间的差异。此外,PGM采用渐进策略,通过多个动态匹配过程来解决不平衡问题。基于PGM,我们设计了一个交替交叉对比学习(ACCL)模块,利用挖掘出的跨模态对应关系来缩小模态差距,同时通过交替方案减轻对应关系中噪声的影响。大量实验证明了生成的对应关系的可靠性以及我们方法的有效性。
1.介绍
图1. 思路示意图。不同颜色代表不同的行人。(a)展示了从SYSU-MM01数据集中随机选择的人员的特征分布。跨模态差异远大于各模态内的类间方差。(b)概括了现有解决方案。将局部距离最近的未匹配跨模态簇视为对应关系。(b)的底部指出了其两个缺点:1) 它忽略了不同身份之间的全局信息;2) 它忽略了跨模态的簇不平衡问题,并丢弃了剩余节点( )。(c)是渐进图匹配方法。我们利用图匹配获得全局最优对应关系,并设计了一种渐进策略来处理簇不平衡问题。可见光-红外行人重识别(VI-ReID)[23, 25, 38, 51, 52]的目标是,在给定来自一种模态的图像时,从一组可见光/红外图库图像中识别出同一个人。由于该任务在夜间智能监控和公共安全领域具有重要意义,最近受到了广泛关注。在可见光-红外行人重识别方面已经取得了许多进展[3, 5, 29, 40, 51]。然而,这些方法需要经过精细标注的训练集,而获取这样的训练集非常耗费精力,因此在实际场景中不太适用。鉴于这一局限性,我们试图探索一种针对可见光-红外行人重识别的无监督解决方案。
对于无监督单模态行人重识别,广泛研究的工作[4, 7, 9, 34, 42, 57]利用基于聚类的方法在同构空间中生成监督信号。然而,在可见光 - 红外异构空间中,由于模态差距较大,特征和语义的一致性无法维持。具体而言,跨模态差异远大于各模态内的类间差异(见图1a)。因此,我们无法通过采用现成的聚类方法在两种模态之间建立联系。然而,跨模态对应关系在弥合两种异构模态之间的模态差距方面起着重要作用[25, 29, 40, 51, 52]。没有可靠的跨模态对应关系,模型很难学习到模态不变特征。
最近,已有一些研究[22,33,45]致力于寻找跨模态对应关系。然而,现有的大多数方法仅考虑局部信息,未能充分利用不同身份之间的全局关系(见图1b)。更糟糕的是,这些方法并不适用于存在聚类不平衡问题的场景,因为部分聚类无法找到其对应的匹配项,这阻碍了后续缩小模态差距的进程。为了在聚类不平衡的场景下全局挖掘跨模态对应关系,我们提出了渐进图匹配(PGM)方法。该方法有两个设计特点:其一,通过图匹配将两种模态联系起来;其二,采用渐进策略解决不平衡问题。
首先,我们采用图匹配方法,在全局约束下充分利用不同身份之间的关系(见图1c左侧)。PGM将跨模态对应关系挖掘过程表述为一个二分图匹配问题,将每种模态视为一个图,每个聚类视为一个节点。节点之间的匹配成本与聚类之间的距离呈正相关。通过最小化全局匹配成本,图匹配有望在全局考量下生成更可靠的对应关系。已有研究表明,图匹配在两组特征之间的无监督对应定位中具有优势[6, 35, 44, 49, 50]。基于这一特性,我们受到启发,为每种模态构建一个图,以连接不同模态下的同一个人。
其次,我们提出一种渐进策略来解决不平衡问题。基本的图匹配方法无法处理跨模态的聚类不平衡问题,这一问题是由类内相机差异导致的。同一个人的实例有时会被划分到不同的聚类中[4, 57],并且一些聚类无法找到其跨模态对应项(见图1c)。这种对应缺失问题影响了模态差异的进一步缩小。对此,我们提议通过多次动态匹配为每个聚类寻找对应项(见图1c右侧)。二分图中的子图会根据之前的匹配结果动态更新,直到每个聚类逐步找到其对应项。通过这种渐进策略,具有相同人员ID的不同聚类能够找到相同的跨模态对应项。因此,这些多对一的匹配结果缓解了不平衡问题,同时也在无形中增强了类内紧凑性。
此外,为了充分利用挖掘出的跨模态对应关系,我们设计了一种新颖的交替交叉对比学习(ACCL)模块。受[23,25,47]等有监督方法的启发,交叉对比学习(CCL)通过将实例拉近其对应的跨模态代理并推离其他代理来减小模态差异。然而,与有监督的设置不同,无监督方法生成的跨模态对应关系不可避免地存在噪声,因此直接结合两种单向度量损失(从可见光到红外光和从红外光到可见光)可能会导致快速的错误 “关联”。我们建议交替使用两种单向度量损失,以便跨模态正样本对可以分阶段关联。这种交替方案减轻了噪声的影响,因为误报对不会长时间存在。通过这种替代方式,噪声的影响将被降低(详见3.3节)。
我们的主要贡献总结如下:
- 我们提出了PGM方法,用于为无监督的可见光-红外行人重识别挖掘可靠的跨模态对应关系。我们首先构建模态图并进行图匹配,以考虑不同身份之间的全局信息,同时设计了一种渐进策略,使匹配过程适用于不平衡的聚类。
- 我们设计了ACCL模块来减小模态差异,通过将实例聚集到其对应的跨模态代理,促进了模态不变信息的学习。交替更新方案旨在减轻有噪声的跨模态对应关系的影响。
- 大量实验表明,PGM方法能提供相对可靠的跨模态对应关系,并且我们提出的方法在无监督的可见光-红外行人重识别中取得了显著的性能提升。
2.相关工作
2.1 可见光-红外行人重识别
由于在24小时监控方面的潜力,有监督的可见光-红外行人重识别(VI-ReID)最近受到越来越多的关注。它主要面临着源于不同光谱相机的模态差异问题[38]。为了缓解跨模态差异,许多研究采用特征级约束,将异质图像嵌入到共享特征空间中,以对齐特征分布[23,25,40,47]。其中,文献[25]利用单向跨模态度量来减轻中继效应并促进模态关联。另一种具有代表性的常用方法是从现有模态中补充缺失的特定模态信息[21, 32, 36, 55, 58]。Zhang first等人提出了FMCNet[55],在特征层面而非图像层面补偿缺失的特定模态信息。然而,上述有监督方法的成功部分归因于拥有经过良好标注的训练数据集。
无监督可见光-红外行人重识别(Unsupervised VI-ReID)的提出是为了解决标注数据缺乏的问题。H2H[22]首次尝试通过提出一种两阶段学习方法来解决这一具有挑战性的问题。在OTLA[33]中,Wang等人基于最优传输策略尝试为红外图像分配伪可见光标签。这些方法需要额外的RGB数据集进行预训练,而且OTLA还假设每个可见光标签分配给相似数量的红外图像,这在实际中可能并不成立。Yang等人[45]首次通过跨模态记忆聚合挖掘聚类级别的关系,但该方法缺乏全局考量,无法处理聚类不平衡问题。
2.2 无监督行人重识别
为了缓解标注与性能之间的矛盾,无监督行人重识别受到了越来越多的关注。这些方法大致可分为无监督域适应(UDA)和无监督学习(USL)方法。基于UDA的方法旨在将在有标签源域上训练的模型适配到无标签目标域[28]。在基于UDA的方法中,一些研究[19, 26, 63, 64]试图通过从有标签的源数据集和无标签的目标数据集中寻找正样本对或负样本对来缩小域差距。还有一些研究[11, 37, 62]倾向于使用生成网络将源域图像转换为目标域风格。另一种方法是通过聚类算法从目标域获取伪标签[1, 13 - 15, 60]。USL方法[7, 24, 31, 43, 46, 56, 57, 61]主要基于伪标签,以监督学习的方式搭建桥梁。然而,由于可见光图像和红外图像之间存在较大的模态差异,为单模态行人重识别设计的无监督方法并不适用于可见光 - 红外行人重识别。
2.3 行人重识别中的图匹配
在单模态行人重识别的背景下,图匹配主要有两种应用方式。其一,将行人图像划分为多个切片或部分,每个切片或部分被视作图中的一个节点[41, 59]。图匹配用于对齐不同行人图像的各个部分。其二,在文献[16, 39, 50]中,每个摄像头视角被视为一个图,摄像头中的每个人则被视为一个节点。图匹配用于跨多个摄像头识别同一个人。然而,对于可见光-红外行人重识别(VI-ReID)而言,跨模态差异远大于各模态内的摄像头间差异。因此,我们为每种模态构建一个图,并利用图匹配来探索跨模态的对应关系。
3.方法
我们所提方法的框架如图2所示。我们首先利用双对比学习(DCL [45])框架来学习模态内的可区分性,该框架通过联合模态内对比学习进行优化。基于双对比学习,我们所提方法着重于其新颖的渐进图匹配(图2中间部分)和交替交叉对比学习模块(图2右侧部分),这两部分将分别在3.2节和3.3节中详细介绍。
图2展示了我们框架的流程。不同颜色表示不同的行人。它包含双对比学习框架(基线,在3.1节中描述)以及两个关键的新颖组件:渐进图匹配(PGM,在3.2节中描述)方法和交替交叉对比学习(ACCL,在3.3节中描述)模块。提出渐进图匹配方法是为了找到可靠的跨模态对应关系(存储在从可见光到红外(V2R)以及从红外到可见光(R2V)中),这些对应关系会参与到后续的交替交叉对比学习中,以学习模态不变特征。3.1 双对比学习框架
给定一个可见光-红外训练数据集 ,其中表示包含个可见光实例的可见光数据集,表示张红外图像。需要注意的是,通道增强[51]是一种常见且有效的数据增强方法,可用于弥合可见光图像与红外图像之间的差距,因此在可见光图像流的学习过程中使用了经过通道增强(CA)的图像来辅助学习。
通道增强(CA)在另一篇文章中也有用到,用来挖掘和颜色无关的信息,在可见光红外行人重识别中经常使用。
双流主干网络(例如,残差网络50 [17] 和注意力引导的加权网络[53]) 用于提取这些行人图像的特征。在通过DBSCAN算法[12]对特征进行聚类后,构建可见光记忆体和红外记忆体。 是模态(,分别表示可见光模态和红外模态)的记忆体,其中 是特征维度, 是模态 的聚类数量。每个代理表示同一聚类的所有实例,并且记忆体的每个条目都使用其对应的代理的平均特征进行初始化。记忆体通过以下公式进行更新: 其中 存储模态 中第 类的特征质心。此外, 是第 类中的一幅图像, 是记忆体更新率。
这个主干网络和ADCA差不多,就是针对红外和可见光各自先用一个特征提取器去提取特征,然后再用共享的特征提取器去提取特征,提取到的特征放到记忆库当中,采用动量更新的方式去进行更新
在训练过程中的一个小批量数据中,对于红外模态,我们按照[18]中的方法,随机采样个类别,且每个类别采样个样本。考虑到每个可见光图像都有其增强的通道增强(CA)图像,为了平衡不同模态的图像数量,我们随机选择个类别,每个类别包含个可见光图像及其生成的个通道增强(CA)图像。对于红外模态,聚类对比学习(ClusterNCE)[9]损失为:
(2) 其中是红外实例的数量,是图像的类别(伪标签)。此外,是一个温度因子。这个损失函数通过将一个实例聚集到其所属类别的代理附近,同时分散其他所有代理来实现分类。可见光模态及其通道增强(CA)模态的损失函数分别用和表示。它们的表达式与公式(2)类似,在此省略。和的详细内容见补充材料。 (3)
双对比学习(DCL)损失函数整合了这些聚类对比学习(ClusterNCE)[9]损失,这有助于模型学习模态内的可区分性,并且增强后的流有助于学习特定的模态不变特征。
3.2. 渐进图匹配
上述的双对比学习(DCL)并没有直接探究两种模态之间的关系,因此无法应对模态差异过大的情况。为了将可见光数据和红外数据联系起来,我们提出了渐进图匹配(PGM)方法,以找到可靠的跨模态对应关系。
ADCA中,为了找到可靠的跨模态对应关系,用到了相似度计算和记数优先选择。这篇文章通过渐进图匹配的方式找到更可靠的跨模态对应关系。
符号定义。我们为每种模态构建一个图,并且每个图都可以看作是二分图的一部分。假设可见光图包含个节点(聚类),可以表示为。类似地,红外图包含个红外节点,由表示。我们使用来表示分配成本矩阵,其中每个元素表示节点和节点之间的不相似性。我们的目标是为中的每个节点在中找到对应关系。我们假设,这表明两种模态中的聚类数量是不同的。
成本矩阵。图匹配方法中的分配成本可以用在一定度量下不同聚类的特征之间的不相似性来表示。匹配成本的基本思想是根据特征差异对跨两种模态的匹配聚类进行惩罚。也就是说,聚类的特征越相似,成本就越低。我们设计了一个简单而有效的成本表达式,其公式如下:
其中表示聚类中的实例数量,是聚类内的实例。聚类内实例的平均特征表示为聚类的表征。
基本图匹配公式。我们按照文献[30]给出基本图匹配(BGM)公式的定义,它可以表示为带有线性约束的二元线性规划:
约束条件为:,
,
,
其中 是节点 和 匹配的一个指示量,用于表明 和 是否属于同一个人( 表示属于同一个人, 表示不属于同一个人)。诸如匈牙利算法[2]等各种高效的求解方法可用于解决基本匹配问题,因此我们不会详细描述这些算法。
给定成本矩阵,基本图匹配(BGM)输出矩阵,矩阵中有个元素的值为,这些值为的元素代表了个匹配的正样本对。需要注意的是,并非可见光图中的每个节点都能找到一个节点使得(见公式(5)的第三行,这表明在可见光模态中存在一些聚类无法找到它们的对应关系)。此外,我们将介绍渐进图匹配(PGM)方法来处理匹配过程中的不平衡问题。
渐进图匹配方法。渐进图匹配(PGM)方法的核心思想是通过多次动态匹配为每个节点找到对应关系。具体来说,我们假设可见光图中的节点数量多于红外图中的节点数量。在执行一次基本图匹配(BGM)过程后,可见光图中会有一些节点尚未找到其对应关系,而红外图中的节点都已找到对应关系。我们利用可见光图中剩余的节点及其之间的边动态地重构一个新图(标记为 )。将和重新组合成一个二分图,并将执行一个新的基本图匹配(BGM)过程。需要注意的是,红外图中的节点不会更新它们的对应关系,因为它们已经找到了一个对应关系。在新的基本图匹配(BGM)过程中,只有可见光图中的节点会更新它们的对应关系。会反复执行基本图匹配(BGM),直到每个节点逐步找到其对应关系。具体细节见算法1。
3.3. 交替交叉对比学习
交叉对比学习(CCL)。交叉对比学习由两个单向学习组成,即从红外到可见光(R2V)学习和从可见光到红外(V2R)学习。前者可以表示为:
其中。是红外图像的伪标签,是的跨模态对应关系,也是的跨模态标签。交叉对比学习可以通过将给定样本聚集到其对应的跨模态代理来弥合模态差距。从可见光到红外的学习具有类似的形式,并添加了通道增强(CA)辅助学习,记为。不同之处在于个图像中有一半是可见光图像,另一半是它们对应的通道增强(CA)图像。的详细信息在补充材料中给出。交替交叉对比学习(ACCL)。对于交叉对比学习(CCL)而言,一个直观的损失函数是将从可见光到红外()和从红外到可见光()的损失相结合,可表示为: 。(7)
然而,这种组合会放大跨模态对应关系中的噪声,导致假阳性对的错误关联。我们设计了一种交替更新方案,在该方案中,跨模态学习在不同的迭代时期选择单向度量,其可以表示为:
其中“epoch”表示迭代的索引。
总体损失被定义为与跨模态对比学习损失的组合,其中带有一个加权参数:
图3. 组合方案( )与交替方案( )的比较。圆圈和三角形中的颜色表示人员身份标识。 和 分别表示在第个时期和第个时期的拉力。红色和绿色的边分别代表聚类在第个时期和第个时期的位置。在第个时期, 通过强大的双向力关联两对(正确的或错误的)。对于 ,真实的一对在经过两轮单向力作用后建立关联,而如果错误的一对在下一个时期未匹配,则它们无法建立关联。原理分析。我们交替使用两种单向度量损失(),而不是直接将它们组合成双向损失()。直接组合的双向损失通常用于有监督的设置中(文献[25,48]),用于关联两种模态。然而,它在无监督的场景中并不适用。原因在于,通过无监督方法获得的跨模态对应关系不可避免地不稳定且存在噪声,“强”双向力会放大噪声并导致错误关联。交替单向学习通过两种新颖的设计来关联两种不同的模态并减轻噪声的影响,即:1)学习单向度量;2)交替使用单向度量。与双向度量相比,前者作为一种“较弱”的力,可防止错误配对过快地建立关联。后者确保模型不会偏向于某一模态,并且真正的配对可以通过多次交替逐步建立关联。错误的配对通常不会持续很长时间,因此它们无法逐步建立关联(见图3)。