Segmentation sémantique d'images avec peu d'exemples basée sur un réseau Transformer à double attention croisée

LIU Yu ,  

GUO Yingchun ,  

ZHU Ye ,  

YU Ming ,  

摘要

La segmentation sémantique d'images avec peu d'exemples peut segmenter de nouvelles classes en utilisant un nombre réduit d'échantillons. Pour résoudre le problème de l'extraction insuffisante d'informations sémantiques dans les méthodes existantes, cet article propose une méthode de segmentation sémantique d'images avec peu d'exemples basée sur un réseau d'attention croisée double. Cette méthode utilise une structure Transformer et exploite un module d'attention croisée double pour apprendre simultanément les dépendances à distance entre les caractéristiques de requête multi-échelles et les caractéristiques de support, à la fois sur les dimensions des canaux et de l'espace. Tout d'abord, cet article propose un module d'attention croisée par canal, qui, combiné avec un module d'attention croisée par position, forme le module d'attention croisée double. Le module d'attention croisée par canal apprend les relations sémantiques entre les caractéristiques de requête et de support sur les canaux, tandis que le module d'attention croisée par position capte les corrélations contextuelles à distance entre les caractéristiques de requête et de support. Ensuite, plusieurs modules d'attention croisée double fournissent des caractéristiques d'interaction multi-échelles riches en informations sémantiques pour l'image de requête. Enfin, cet article introduit une perte de supervision auxiliaire et connecte les caractéristiques d'interaction multi-échelles au décodeur via un suréchantillonnage et une connexion résiduelle afin d'obtenir des résultats de segmentation précis pour les nouvelles classes. La méthode a atteint un mIoU de 69,9 % (1-shot) et de 72,4 % (5-shot) sur le dataset PASCAL-5i, et de 48,9 % (1-shot) et 54,6 % (5-shot) sur le dataset COCO-20i. Comparée aux méthodes courantes, la performance de segmentation de cette méthode atteint un niveau de pointe.

关键词

Segmentation sémantique d'images avec peu d'exemples;Structure Transformer;Attention croisée par canal;Double attention croisée;Perte auxiliaire

阅读全文

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website