Méthode de reconnaissance visuelle des lieux basée sur un mécanisme d'attention dynamique parallèle sur toutes les dimensions

LIU Peijin ,  

LIU Shujie ,  

HE Lin ,  

PENG Lijun ,  

FU Xuefeng ,  

摘要

Pour résoudre le problème de faible robustesse de la reconnaissance visuelle des lieux causée par des variations environnementales telles que la météo, les saisons et la luminosité, un mécanisme d'attention multidimensionnelle a été proposé pour améliorer la robustesse des descripteurs de caractéristiques de reconnaissance visuelle des lieux — le mécanisme d'attention dynamique parallèle sur toutes les dimensions (POD-Attention). Afin de réaliser une exploration dynamique et fine des noyaux convolutifs sur toutes les dimensions, et d'améliorer la capacité du réseau d'extraction de caractéristiques à extraire et apprendre des caractéristiques invariantes telles que les bâtiments, un bloc de convolution dynamique sur toutes les dimensions ajoute une attention complémentaire sur toutes les dimensions du noyau (canaux d'entrée et de sortie, espace convolutif et nombre de noyaux). La fusion parallèle de convolutions 1×1, du module Skip Squeeze-and-Excitation (SSE) et du bloc de convolution dynamique sur toutes les dimensions améliore non seulement efficacement la vitesse d'extraction des caractéristiques, mais élargit également le champ réceptif du réseau de reconnaissance visuelle des lieux, améliorant plus loin la précision de reconnaissance. Les expériences sur des ensembles de données publics montrent que la méthode de reconnaissance visuelle des lieux basée sur l'agrégation de caractéristiques VGG16 et Patch-NetVLAD, améliorée par le mécanisme d'attention POD, a augmenté les scores Recall@1 de 9,7 % et 1,8 % sur les ensembles de données Nordland et Mapillary Street-Level Sequences respectivement, démontrant ainsi pleinement l'effet d'amélioration des performances du réseau par le mécanisme POD ainsi que l'efficacité de la méthode de reconnaissance visuelle des lieux basée sur ce mécanisme.

关键词

reconnaissance visuelle des lieux;robustesse environnementale;apprentissage profond;mécanisme d'attention dynamique parallèle sur toutes les dimensions;stratégie parallèle

阅读全文

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website