Détection des changements dans les images de télédétection basée sur une architecture CNN-Transformer

PAN Mengyang ,  

YANG Hang ,  

FAN Xianghui ,  

摘要

La détection des changements dans les images de télédétection à haute résolution moderne a obtenu des résultats remarquables grâce aux réseaux de neurones convolutionnels (Convolutional Neural Network, CNN). Cependant, la limitation du champ réceptif des opérations convolutionnelles entraîne des insuffisances dans l’apprentissage du contexte global et des relations spatiales à longue distance. Bien que le Transformer visuel puisse efficacement capturer les dépendances des caractéristiques lointaines, son traitement des détails des changements d’image est insuffisant, conduisant à une capacité de localisation spatiale limitée et une faible efficacité de calcul. Pour résoudre ces problèmes, cet article propose un modèle de détection des changements basé sur une fusion linéaire en cascade inter-couches avec un encodeur-décodeur hybride CNN-Transformer intégré de bout en bout, basé sur un pooling pyramidal dilaté spatial, combinant les avantages du Transformer visuel et du CNN. Tout d’abord, un réseau CNN jumeau est utilisé pour extraire les caractéristiques d’image, qui sont traitées avec précision à l’aide d’un module de pooling pyramidal dilaté afin de mieux capturer les informations détaillées des caractéristiques. Ensuite, les caractéristiques extraites sont converties en mots visuels et modélisées via un encodeur Transformer pour obtenir des informations contextuelles riches. Ces informations sont ensuite rétropropagées dans l’espace visuel pour renforcer les caractéristiques originales à l’aide d’un décodeur Transformer, améliorant ainsi l’expression des caractéristiques. Puis, une fusion en cascade inter-couches est utilisée pour intégrer les caractéristiques extraites par le CNN et celles encodées/décodées par le Transformer, utilisant la technique de suréchantillonnage pour relier les différentes résolutions des cartes de caractéristiques et fusionner les informations positionnelles et sémantiques. Enfin, un module d’amélioration des différences génère une carte de caractéristiques de différences riche en informations de changement. Des expériences étendues sur quatre ensembles de données publiques de télédétection, LEVIR, CDD, DSIFN et WHUCD, ont validé l’efficacité de la méthode proposée. Comparé à d’autres méthodes avancées, notre modèle présente de meilleures performances de classification, améliorant efficacement les problèmes de sous-segmentation, sur-segmentation et de bords irréguliers dans la détection des changements.

关键词

images de télédétection; détection des changements; réseaux de neurones convolutionnels; Transformer; pooling pyramidal dilaté spatial

阅读全文

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website