Segmentación semántica de imágenes con pocas muestras basada en una red Transformer de atención cruzada doble

LIU Yu ,  

GUO Yingchun ,  

ZHU Ye ,  

YU Ming ,  

摘要

La segmentación semántica de imágenes con pocas muestras puede segmentar nuevas clases usando solo una pequeña cantidad de muestras. Para abordar el problema de la extracción insuficiente de información semántica en los métodos existentes, este artículo propone un método de segmentación semántica de imágenes con pocas muestras basado en una red de atención cruzada doble. Este método utiliza una estructura Transformer y emplea un módulo de atención cruzada doble para aprender simultáneamente las dependencias remotas entre las características de consulta y las características de soporte a múltiples escalas desde las dimensiones de canal y espacial. En primer lugar, este artículo propone un módulo de atención cruzada por canal, que combinado con un módulo de atención cruzada por posición conforman el módulo de atención cruzada doble. El módulo de atención cruzada por canal se utiliza para aprender las relaciones semánticas entre canal entre las características de consulta y soporte, mientras que el módulo de atención cruzada por posición captura la correlación contextual remota entre las características de consulta y soporte. Luego, mediante varios módulos de atención cruzada doble, se pueden proporcionar características interactivas multiescala ricas en información semántica para la imagen de consulta. Finalmente, este trabajo introduce una pérdida de supervisión auxiliar y conecta las características interactivas multiescala al decodificador a través de sobremuestreo y conexión residual para obtener resultados precisos de segmentación de nuevas clases. El método alcanzó una mIoU de 69.9% (1-shot) y 72.4% (5-shot) en el conjunto de datos PASCAL-5i, y una mIoU de 48.9% (1-shot) y 54.6% (5-shot) en el conjunto de datos COCO-20i. En comparación con los métodos principales, el rendimiento de segmentación de este método alcanza un nivel avanzado.

关键词

Segmentación semántica de imágenes con pocas muestras;Estructura Transformer;Atención cruzada por canal;Atención cruzada doble;Pérdida auxiliar

阅读全文

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website