Detección de cambios en imágenes de teledetección basada en la estructura CNN-Transformer

PAN Mengyang ,  

YANG Hang ,  

FAN Xianghui ,  

摘要

La detección de cambios en imágenes modernas de teledetección de alta resolución ha logrado resultados significativos mediante redes neuronales convolucionales (Convolutional Neural Network, CNN). Sin embargo, la limitación del campo receptivo de las operaciones convolucionales conduce a deficiencias en el aprendizaje del contexto global y las relaciones espaciales a largo alcance. Aunque el Transformer visual puede capturar eficazmente la dependencia de características remotas, su manejo de los detalles de cambio en la imagen es insuficiente, lo que resulta en una capacidad limitada de localización espacial y baja eficiencia computacional. Para resolver estos problemas, este artículo propone un modelo de detección de cambios basado en una fusión lineal en cascada intercapas con un codificador-decodificador híbrido CNN-Transformer de extremo a extremo basado en un agrupamiento piramidal dilatado espacial, que combina las ventajas del Transformer visual y CNN. Primero, se utiliza una red CNN gemela para extraer características de imagen y se procesan finamente mediante un módulo de agrupamiento piramidal dilatado para capturar con mayor precisión las características detalladas de la imagen. Luego, las características extraídas se convierten en palabras visuales y se modelan mediante un codificador Transformer para obtener información contextual rica. Esta información se retroalimenta al espacio visual y se refuerzan las características originales mediante un decodificador Transformer, mejorando la expresión de las características. Posteriormente, mediante una fusión en cascada intercapas, se combinan las características extraídas por CNN y las características codificadas/decodificadas por Transformer, utilizando la técnica de sobremuestreo para conectar mapas de características con diferentes resoluciones, logrando la fusión de información de posición y semántica. Finalmente, un módulo de realce de diferencias genera un mapa de características de diferencias con información rica sobre cambios. Amplios experimentos en 4 conjuntos de datos públicos de teledetección LEVIR, CDD, DSIFN y WHUCD validaron la efectividad del método propuesto. En comparación con otros métodos avanzados, el modelo propuesto muestra un mejor rendimiento de clasificación y mejora eficazmente problemas de subsegmentación, sobresegmentación y bordes ásperos en la detección de cambios.

关键词

imágenes de teledetección; detección de cambios; redes neuronales convolucionales; Transformer; agrupamiento piramidal dilatado espacial

阅读全文

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website