نموذج تلخيص فيديو قائم على النمذجة الزمنية متعددة المقاييس ودمج السمات المكانية الديناميكية

LI Zehui ,  

ZHANG Lin ,  

SHAN Xianying ,  

SHEN Ganjie ,  

摘要

لمعالجة مشكلة النمذجة الزمنية متعددة المقاييس والسمات المحلية غير الكافية في مهمة تلخيص الفيديو، يقترح هذا البحث نموذج تلخيص فيديو يجمع بين انزياح زمني متعدد المقاييس وآلية الانتباه المحلي القابلة للتشوه. أولاً، تم تصميم وحدة انزياح زمني ثنائية الاتجاه متعددة المقاييس قابلة للتكيف (MAB-TSM)، من خلال التنبؤ بخطوة الإزاحة الديناميكية القابلة للتعلم والتلافيف المتوسعة متعددة المقاييس، لتحقيق نمذجة تكيفية للاعتماد الزمني طويل وقصير الأمد للفيديو؛ ثانيًا، تم تصميم وحدة الانتباه المحلي القابل للتشوه (DALAM)، التي تجمع بين استراتيجية تقسيم الفيديو الديناميكية وآلية ضبط مواقع العينة التكيفية، مما يعزز التعبير الدقيق للسمات في المناطق الرئيسية المحلية مع تقليل التعقيد الحسابي؛ علاوة على ذلك، تم تحسين شبكة BiFPN لدمج المقاييس المختلفة عبر مقياس، وتم إدخال وحدة تعزيز الانتباه عبر المقاييس بناءً على BiFPN لتعزيز تعبير التكامل التكاملي للسمات متعددة المقاييس. لقد أجريت تجارب متعددة على مجموعات بيانات SumMe وTVSum، حيث حقق النموذج درجات F1 بنسبة 56.8٪ و62.6٪ على التوالي في الوضع الموحد، متفوقًا على الأساليب الحالية، كما بلغ معامل ارتباط الرتب Kendall ومعامل ارتباط الرتب Spearman 0.153 و0.200 على التوالي، مما يعكس توافقًا جيدًا. تؤكد نتائج التجارب دقة وفعالية النموذج في مهمة تلخيص الفيديو.

关键词

تلخيص الفيديو;النمذجة الزمنية متعددة المقاييس;وحدة انزياح زمني;الانتباه القابل للتشوه;آلية الانتباه المحلية

阅读全文

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website