Red de estimación de postura basada en la fusión de características atencionales multimodales

ZHAO Yuntao ,  

DENG Xinhui ,  

摘要

La estimación de postura 6D que equilibra precisión y aplicabilidad ha sido un tema destacado y desafiante en la investigación. Este artículo propone una red de estimación de postura 6D basada en la fusión de características atencionales multimodales. Primero, se introduce una estructura de módulo de squeeze-and-excitation más profunda, que mejora la dependencia y amplía el campo receptivo ajustando los pesos de los canales, mejorando así el procesamiento de características de imágenes RGB. Además, para datos multimodales, se despliega un módulo iterativo de fusión de características atencionales en la fase de fusión de características, que mediante múltiples iteraciones ayuda a resolver los problemas de incompatibilidad de escala en la fusión global de características, permitiendo capturar e integrar datos multimodales con mayor precisión y mejorando significativamente la regresión de postura. Finalmente, para evaluar cuantitativamente la robustez y aplicabilidad del modelo en entornos complejos, se introduce un indicador de porcentaje invisible, que evalúa el desempeño del modelo ante oclusiones parciales o fondos complejos. Experimentos de predicción de postura en conjuntos de datos públicos verificaron que el modelo mejorado no solo logra predicciones precisas en datos de validación, sino que, en comparación con el modelo Densefusion, presenta una mejor aplicabilidad en entornos complejos.

关键词

Estimación de postura 6D; datos multimodales; fusión de características atencionales; porcentaje invisible

阅读全文

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website