تقسيم الصور الدلالي بمجموعة عينات صغيرة اعتماداً على شبكة Transformer بانتباه متقاطع مزدوج

LIU Yu ,  

GUO Yingchun ,  

ZHU Ye ,  

YU Ming ,  

摘要

تقسيم الصور الدلالي بمجموعة عينات صغيرة يمكنه تقسيم فئات جديدة باستخدام عدد قليل فقط من العينات. لمواجهة مشكلة عدم كفاية استخراج المعلومات الدلالية في الطرق الحالية، يقترح هذا البحث طريقة تقسيم صور دلالية بمجموعة عينات صغيرة تعتمد على شبكة الانتباه المتقاطع المزدوجة. تستخدم الطريقة بنية Transformer، وتستفيد من وحدة الانتباه المتقاطع المزدوجة لتتعلم في نفس الوقت الاعتماديات البعيدة بين ميزات الاستعلام والميزات الداعمة متعددة المقاييس من خلال البعدين القنواتي والمكاني. أولاً، يقترح هذا البحث وحدة الانتباه المتقاطع القنواتي، ويدمجها مع وحدة الانتباه المتقاطع المكاني لتكوين وحدة الانتباه المتقاطع المزدوجة. حيث تُستخدم وحدة الانتباه المتقاطع القنواتي لتعلم العلاقة الدلالية القنواتية بين ميزات الاستعلام والدعم، بينما تُستخدم وحدة الانتباه المتقاطع المكاني لالتقاط الارتباط السياقي البعيد بين ميزات الاستعلام والدعم. ثم، من خلال عدة وحدات انتباه متقاطعة مزدوجة، يمكن توفير ميزات تفاعلية متعددة المقاييس غنية بالمعلومات الدلالية لصورة الاستعلام. أخيراً، يدخل البحث الإشراف المساعد، ويربط ميزات التفاعل متعددة المقاييس مع وحدة فك الترميز عبر رفع التدرج والاتصال المتبقي للحصول على نتائج تقسيم دقيقة للفئات الجديدة. حققت هذه الطريقة في مجموعة البيانات PASCAL-5i نسبة mIoU بلغت 69.9% (لـ1-shot) و72.4% (لـ5-shot)، وفي مجموعة البيانات COCO-20i نسبة mIoU بلغت 48.9% (لـ1-shot) و54.6% (لـ5-shot). بالمقارنة مع الطرق السائدة، وصلت هذه الطريقة إلى مستوى متقدم في أداء التقسيم.

关键词

تقسيم الصور الدلالي بمجموعة عينات صغيرة;بنية Transformer;انتباه متقاطع قنواتي;انتباه متقاطع مزدوج;خسارة مساعد

阅读全文

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website