Multimodale semantische Bildsegmentierung basierend auf einem Aufmerksamkeitsmechanismus

ZHANG Ji-you ,  

ZHANG Rong-fen ,  

LIU Yu-hong ,  

YUAN Wen-hao ,  

摘要

Viele aktuelle semantische Segmentierungsmodelle verwenden Trainingsdaten aus RGB-Bildern. In einigen extremen Umgebungen leidet die Stabilität der Modelle stark, was den tatsächlichen Anforderungen des autonomen Fahrens bei Nacht nicht entspricht. Um das Problem der semantischen Segmentierung von Nachtszenen zu lösen, wurde ResNet-152 als Merkmalsextraktionsnetzwerk verwendet und ein multimodales Doppel-Encoder-Decoder-Modell mit integriertem leichtgewichtigem Aufmerksamkeitsmodul entwickelt. Der Doppel-Encoder extrahiert Schlüsselinformationen aus den Modalitäten RGB und T, fusioniert diese über das Aufmerksamkeitsmodul und übergibt die extrahierten Merkmale an den Decoder. Dabei werden phasenweise hochskalierten Merkmalskarten und Merkmalskarten der einzelnen Encoder-Ebenen zusammengeführt, Merkmale über Faltungsschichten extrahiert und die Auflösung durch Upsampling wiederhergestellt, bevor die semantische Segmentierung durchgeführt wird. Die Experimentalergebnisse zeigen, dass die durchschnittliche Genauigkeit und der mittlere Intersection-over-Union (IoU) auf dem MFNet-Testdatensatz 76 % bzw. 55,7 % betragen, was eine Verbesserung gegenüber anderen Netzwerkmodellen darstellt und die grundlegenden Anforderungen an eine präzise semantische Segmentierung von RGB-T-Bildern bei Tages- und Nachtszenen erfüllt.

关键词

Nächtliche semantische Segmentierung; multimodal; leichtgewichtiges Aufmerksamkeitsmodul; multiskalige Information

阅读全文

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website