التقسيم الدلالي للصور متعددة النمط بناءً على آلية الانتباه

ZHANG Ji-you ,  

ZHANG Rong-fen ,  

LIU Yu-hong ,  

YUAN Wen-hao ,  

摘要

تعتمد العديد من نماذج التقسيم الدلالي الحالية على بيانات تدريب من صور RGB، وفي بعض البيئات القاسية، يتأثر استقرار هذه النماذج بشكل كبير، مما لا يلبي الاحتياجات الفعلية للقيادة الذاتية في المشاهد الليلية. لحل مشكلة التقسيم الدلالي في المشاهد الليلية، تم استخدام شبكة ResNet-152 كمستخرج للميزات، وتم بناء نموذج ترميز-فك ترميز ثنائي متعدد النمط يحتوي على وحدة اهتمام خفيفة الوزن مدمجة. يستخرج الترميز الثنائي المعلومات الرئيسية من نمطي RGB وT، ويقوم بدمجها من خلال وحدة الاهتمام، ثم يُرسل المعلومات المميزة المستخرجة إلى فك الترميز، حيث يتم دمج خرائط الميزات الناتجة عن عمليات رفع العينات المرحلية مع خرائط الميزات المستخرجة من طبقات الترميز المختلفة، ثم يتم استخراج الميزات عبر طبقات الالتفاف، واستعادة الدقة من خلال رفع العينات، وأخيراً إجراء التقسيم الدلالي. تظهر نتائج التجارب أن دقة النموذج ومتوسط مؤشر التقاطع على مجموعة اختبار MFNet هما 76% و55.7% على التوالي، مما يمثل تحسناً ملحوظاً مقارنة بالنماذج الأخرى، ويلبي المتطلبات الأساسية للتقسيم الدلالي الدقيق لمشاهد RGB-T النهارية والليلية.

关键词

التقسيم الدلالي الليلي; متعدد النمط; وحدة اهتمام خفيفة الوزن; المعلومات متعددة المقاييس

阅读全文

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website