2025.9.3进展报告
七崽爱吃小饼干2025/09/03阅读 1
目前主要分成两个研究部分:
- 身体部分语义分割模型
- 身体部分语义分割+可见光红外行人重识别
一、第一个问题是身体部分语义分割的精细度
查阅了一些文献,有两种方案
- 比较简单的做法是把人体整个从图像中分割出来,分成前景和背景
- 还有一种精细一些的做法(SPReID)就是把人体分割成头、上身、下身、鞋从上往下的四个部分
- 目前是觉得第二种方案的效果可能会更好
- 主要的身体部分分割数据集Look into Person有20个语义标签,也可以尝试更精细的划分,但是过于精细了效果也不好,可能从上往下进行分割会更好一点
二、身体部分语义分割模型做了以下尝试:
SAM2大模型,目前查到的方案有:
1.提示工程
SAM2可以通过提示点去做分割,这个方案就是训练一个网络专门用来提供提示词。目前感觉这个方案效果不会很好。
2.SAM2 Adapter
之前有很多采用SAM Adapter的,这个是升级版本,只需要微调适配器就可以,但是这个显卡要求还是比较高,官方用的4张A100进行训练,目前我还没尝试我们的设备可不可行。
尝试了一些别的预训练模型:
1.飞桨的PP-HumanSeg
这个比较适合用来做把人体从图像中整个分割出来的工作,不适合太精细的分割
2.facebook的sapiens
这个比较适合精细一些的分割,也有微调方案,可能比较适合我们的可见光红外行人图像的分割。 目前已经跑通了,有28个语义标签类别,高清图像上分割的效果很不错,我用market数据集去尝试分割,可能因为像素低,效果不太好,后续会再调整一下试试。
三、身体部分语义分割 与 可见光红外行人重识别的融合
目前在尝试复现SDCL,去年的CVPR的可见光红外论文,主要问题还是爆显存了,但是batch_size从256调到32还是爆,可能是代码有点问题。
目前查到的把语义分割信息融入进去的一些做法:把分割后得到的概率图,跟原图进行相乘,这样就能得到各个部分的局部特征向量
四、后续计划
先跑通SDCL,然后尝试不同的语义分割数据结合方案
再试一试SAM2 Adapter以及sapiens的微调,用sysu-mm01做一套语义分割标注的可见光红外行人数据集