Segmentation sémantique d’images multimodales basée sur un mécanisme d’attention

ZHANG Ji-you ,  

ZHANG Rong-fen ,  

LIU Yu-hong ,  

YUAN Wen-hao ,  

摘要

De nombreux modèles de segmentation sémantique actuels utilisent des données d’entraînement composées d’images RGB. Dans certains environnements extrêmes, la stabilité de ces modèles est fortement affectée, ce qui ne répond pas aux besoins réels de la conduite autonome nocturne. Pour résoudre le problème de la segmentation sémantique des scènes nocturnes, ResNet-152 a été utilisé comme réseau d'extraction des caractéristiques, et un modèle multimodal à double encodeur-décodeur intégrant un module d’attention léger a été construit. Le double encodeur extrait les informations clés des modalités RGB et T, les fusionne via un module d’attention, puis les caractéristiques extraites sont envoyées au décodeur. Les cartes de caractéristiques issues des différentes phases d’upsampling et des couches de l’encodeur sont concaténées, puis les caractéristiques sont extraites via des couches convolutionnelles, la résolution est restaurée par upsampling, et finalement la segmentation sémantique est réalisée. Les résultats expérimentaux montrent que la précision moyenne et l’IoU moyen sur le jeu de test MFNet sont respectivement de 76 % et 55,7 %, ce qui représente une amélioration par rapport à d’autres modèles de réseau, répondant ainsi aux exigences fondamentales pour une segmentation sémantique précise des images RGB-T en conditions diurnes et nocturnes.

关键词

Segmentation sémantique nocturne; multimodalité; module d’attention léger; information multi-échelle

阅读全文

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website