Netzwerk zur Pose-Schätzung basierend auf aufmerksamer Merkmalsfusion multimodaler Daten

ZHAO Yuntao ,  

DENG Xinhui ,  

摘要

Die 6D-Pose-Schätzung, die Genauigkeit und Anwendbarkeit vereint, ist seit jeher ein wichtiger und schwieriger Forschungsschwerpunkt. Dieser Artikel stellt ein 6D-Pose-Schätznetzwerk vor, das auf der aufmerksamkeitsbasierten Merkmalsfusion multimodaler Daten basiert. Zunächst wird eine tiefere Squeeze-and-Excitation-Modulstruktur eingeführt, die durch Anpassung der Kanalgewichte Abhängigkeiten verstärkt und das Sichtfeld erweitert, wodurch die Verarbeitung von RGB-Bildmerkmalen verbessert wird. Weiterhin wird für multimodale Daten in der Merkmalsfusion ein iteratives aufmerksamkeitsbasiertes Merkmalsfusionsmodul eingesetzt, das durch mehrfache Iterationen das Problem der Skalierungsinkonsistenz bei der globalen Merkmalsfusion löst und eine genauere Erfassung und Integration multimodaler Daten ermöglicht, was die Posenregression deutlich verbessert. Schließlich wird zur quantitativen Bewertung der Robustheit und Anwendbarkeit des Modells in komplexen Umgebungen ein unsichtbarer Prozentsatz eingeführt, der die Leistung des Modells bei teilweiser Verdeckung oder komplexem Hintergrund bewertet. Experimente zur Posenprognose auf öffentlichen Datensätzen bestätigten, dass das verbesserte Modell nicht nur genaue Vorhersagen auf Validierungsdatensätzen erzielt, sondern im Vergleich zum Densefusion-Modell eine bessere Anwendbarkeit in komplexen Umgebungen aufweist.

关键词

6D-Pose-Schätzung; multimodale Daten; aufmerksame Merkmalsfusion; unsichtbarer Prozentsatz

阅读全文

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website