Veränderungserkennung in Fernerkundungsbildern basierend auf der CNN-Transformer-Struktur

PAN Mengyang ,  

YANG Hang ,  

FAN Xianghui ,  

摘要

Die Veränderungserkennung in modernen hochauflösenden Fernerkundungsbildern hat mit Hilfe von Convolutional Neural Networks (CNN) bemerkenswerte Ergebnisse erzielt. Allerdings führt die begrenzte Rezeptivfeldgröße der Faltungsoperationen zu Mängeln beim Lernen des globalen Kontexts und entfernter räumlicher Beziehungen. Obwohl der Vision Transformer effektiv entfernte Merkmalsabhängigkeiten erfassen kann, ist seine Verarbeitung von Bildänderungsdetails unzureichend, was zu einer begrenzten räumlichen Lokalisierungsfähigkeit und geringer Rechenleistung führt. Um diese Probleme zu lösen, wird in diesem Artikel ein Veränderungserkennungsmodell vorgeschlagen, das auf einer räumlich dilatierten Pyramid-Pooling-basierten schichtübergreifenden kaskadierten linearen Fusion eines end-to-end hybriden CNN-Transformer Encoder-Decoders basiert und die Vorteile von Vision Transformer und CNN kombiniert. Zunächst werden Bildmerkmale mit einem Zwillings-CNN-Netzwerk extrahiert und mithilfe eines dilatierten Pyramid-Pooling-Moduls fein verarbeitet, um detaillierte Merkmalsinformationen präziser zu erfassen. Anschließend werden die extrahierten Merkmale in visuelle Wörter umgewandelt und mithilfe eines Transformer-Encoders modelliert, um reichhaltige Kontextinformationen zu erhalten. Diese Informationen werden anschließend in den visuellen Raum zurückgeführt, wobei der Transformer-Decoder die ursprünglichen Merkmale verstärkt und deren Ausdrucksfähigkeit verbessert. Danach erfolgt eine schichtübergreifende kaskadierte Fusion der von CNN extrahierten Merkmale mit den vom Transformer enkodierten und dekodierten Merkmalen. Dabei wird eine Upsampling-Technik verwendet, um Merkmalskarten mit unterschiedlichen Auflösungen zu verbinden und die Verschmelzung von Positions- und semantischen Informationen zu realisieren. Abschließend wird eine Differenzverstärkungseinheit eingesetzt, um eine differenzielle Merkmalskarte mit reichhaltigen Änderungsinformationen zu generieren. Umfangreiche Experimente auf den vier öffentlichen Fernerkundungsdatensätzen LEVIR, CDD, DSIFN und WHUCD bestätigen die Wirksamkeit der vorgeschlagenen Methode. Im Vergleich zu anderen fortschrittlichen Methoden erzielt das Modell eine bessere Klassifikationsleistung und verbessert effektiv die Probleme der Untersegmentierung, Übersegmentierung und rauen Kanten bei der Veränderungserkennung.

关键词

Fernerkundungsbilder; Veränderungserkennung; Convolutional Neural Networks; Transformer; räumlich dilatiertes Pyramid-Pooling

阅读全文

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website