创见博客
2025.9.3进展报告
七崽爱吃小饼干2025/09/03阅读 1

目前主要分成两个研究部分:

  • 身体部分语义分割模型
  • 身体部分语义分割+可见光红外行人重识别

一、第一个问题是身体部分语义分割的精细度

查阅了一些文献,有两种方案
  • 比较简单的做法是把人体整个从图像中分割出来,分成前景和背景
  • 还有一种精细一些的做法(SPReID)就是把人体分割成头、上身、下身、鞋从上往下的四个部分
  • 目前是觉得第二种方案的效果可能会更好
  • 主要的身体部分分割数据集Look into Person有20个语义标签,也可以尝试更精细的划分,但是过于精细了效果也不好,可能从上往下进行分割会更好一点

二、身体部分语义分割模型做了以下尝试:

SAM2大模型,目前查到的方案有:

1.提示工程

SAM2可以通过提示点去做分割,这个方案就是训练一个网络专门用来提供提示词。目前感觉这个方案效果不会很好。

2.SAM2 Adapter

之前有很多采用SAM Adapter的,这个是升级版本,只需要微调适配器就可以,但是这个显卡要求还是比较高,官方用的4张A100进行训练,目前我还没尝试我们的设备可不可行。

尝试了一些别的预训练模型:

1.飞桨的PP-HumanSeg

这个比较适合用来做把人体从图像中整个分割出来的工作,不适合太精细的分割

2.facebook的sapiens

这个比较适合精细一些的分割,也有微调方案,可能比较适合我们的可见光红外行人图像的分割。 目前已经跑通了,有28个语义标签类别,高清图像上分割的效果很不错,我用market数据集去尝试分割,可能因为像素低,效果不太好,后续会再调整一下试试。

三、身体部分语义分割 与 可见光红外行人重识别的融合

目前在尝试复现SDCL,去年的CVPR的可见光红外论文,主要问题还是爆显存了,但是batch_size从256调到32还是爆,可能是代码有点问题。

目前查到的把语义分割信息融入进去的一些做法:把分割后得到的概率图,跟原图进行相乘,这样就能得到各个部分的局部特征向量

四、后续计划

先跑通SDCL,然后尝试不同的语义分割数据结合方案

再试一试SAM2 Adapter以及sapiens的微调,用sysu-mm01做一套语义分割标注的可见光红外行人数据集

评论
0/100