Réseau d’analyse de scènes haute résolution basé sur la segmentation sémantique

SHI Jian-feng ,  

XANG Ning ,  

WANG A-chuan ,  

摘要

Afin de segmenter efficacement des scènes complexes telles que les paysages urbains, cet article combine le réseau haute résolution (HRNet) avec un module de pooling pyramidal (Pyramid pooling module, PPM) pour compléter les informations contextuelles globales, proposant un réseau d’analyse de scènes haute résolution. Premièrement, HRNet est utilisé comme réseau principal d’extraction de caractéristiques, avec une amélioration des modules résiduels largement utilisés grâce à des convolutions dilatées séparables, réduisant le nombre de paramètres tout en améliorant la capacité de segmentation des objets multi-échelles ; ensuite, un cadre de convolutions dilatées hybrides est conçu avec des taux dilatés multiples pour réduire l’effet de grille tout en maintenant un champ réceptif dense ; puis, une structure d’upsampling continue à plusieurs étapes est conçue pour améliorer le mécanisme simple de fusion tardive de HRNetV2 ; enfin, un module de pooling pyramidal amélioré, adaptable à différentes résolutions d’image, est utilisé pour agréger l’information contextuelle de différentes régions afin d’obtenir une carte de segmentation de haute qualité. Une précision de 83,3% MIOU a été atteinte sur le jeu de données CityScapes avec seulement 16,4 Mbit de paramètres, et de bons résultats ont également été obtenus sur le jeu de données Camvid, réalisant une méthode d’analyse de scènes basée sur la segmentation sémantique plus fiable, précise et à faible coût de calcul.

关键词

apprentissage profond;réseaux neuronaux;segmentation sémantique;réseau haute résolution;convolution dilatée

阅读全文

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website