Réseau d'estimation de pose basé sur la fusion des caractéristiques attentionnelles multi-modales

ZHAO Yuntao ,  

DENG Xinhui ,  

摘要

L'estimation de pose 6D conciliant précision et applicabilité a toujours été un sujet de recherche crucial et complexe. Cet article propose un réseau d'estimation de pose 6D basé sur la fusion des caractéristiques attentionnelles multi-modales. Tout d'abord, une structure plus profonde de module de squeeze-and-excitation est introduite, renforçant la dépendance et élargissant le champ réceptif en ajustant les poids des canaux, améliorant ainsi le traitement des caractéristiques d'images RGB. De plus, pour les données multi-modales, un module itératif de fusion des caractéristiques attentionnelles est déployé lors de la phase de fusion des caractéristiques, résolvant par des opérations itératives les problèmes d’incohérence d’échelle dans la fusion globale des caractéristiques, ce qui permet une capture et une intégration plus précises des données multi-modales et améliore significativement la régression de la pose. Enfin, pour évaluer quantitativement la robustesse et l'applicabilité du modèle dans des environnements complexes, un indicateur de pourcentage invisible est introduit, permettant d'évaluer la performance du modèle face aux occultations partielles ou aux arrière-plans complexes. Les expériences de prédiction de pose sur des ensembles de données publiques ont démontré que le modèle amélioré permet non seulement des prédictions précises sur le jeu de validation, mais montre également une meilleure applicabilité en environnement complexe par rapport au modèle Densefusion.

关键词

Estimation de pose 6D; données multi-modales; fusion de caractéristiques attentionnelles; pourcentage invisible

阅读全文

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website