خوارزمية تلخيص فيديو هرمية مبنية على الشبكة العصبونية الدورية المستقلة

REN Xiwei ,  

LIU Yan ,  

XIAO Man ,  

JIA Shiduan ,  

WANG Rui ,  

HE Lifeng ,  

摘要

نظرًا لأن خوارزميات تلخيص الفيديو الحالية تتجاهل معلومات اللقطات مما يؤدي إلى تلف تكامل النشاط، وصعوبة خوارزميات RNN وLSTM التقليدية في التقاط الاعتماد طويل المدى عند معالجة الفيديوهات الطويلة، قدم هذا البحث خوارزمية تلخيص فيديو هرمية مبنية على IndRNN استنادًا إلى الهيكل الهرمي لتسلسل الفيديو (HIRVS). يمكن تقسيم HIRVS إلى 3 أجزاء: (1) استخدام شبكة IndRNN لتوليد الميزات المرئية لكل لقطة، حيث تكون الحالة المخفية النهائية هي تجميع زمني موزون لميزات جميع الإطارات داخل اللقطة؛ (2) استخدام سلسلة ميزات اللقطات على مستوى اللقطة بواسطة IndRNN ثنائي الاتجاه لنمذجة العلاقات الزمنية والتقاط الاعتماد طويل المدى بين اللقطات؛ (3) إدخال مشفر الفيديو ذاتي الانتباه لاستخلاص الاعتمادات العالمية في الفيديو. في النهاية، يتم توقع درجة أهمية لقطات الفيديو لاختيار اللقطات الرئيسية لتوليد ملخص الفيديو. أُجريت التجارب على مجموعتي البيانات العامتين SumMe وTvSum، حيث وصلت درجة F في مجموعة SumMe إلى 51.0٪، محققة تحسنًا بنسبة 1.2٪ مقارنة بـ VOGNet؛ وعلى مجموعة TVSum وصلت درجة F إلى 61.3٪، متفوقة بنسبة 0.3٪ على أفضل الطرق الحالية VJMHT. تثبت النتائج التجريبية فعالية HIRVS في مهام تلخيص الفيديو، مع تحسين كفاءة توليد الملخص.

关键词

تلخيص الفيديو;الشبكة العصبونية الدورية المستقلة;البنية الهرمية;شبكة الانتباه الذاتي

阅读全文

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website