Videozusammenfassungsmodell basierend auf mehrskaliger zeitlicher Modellierung und dynamischer räumlicher Merkmalsfusion

LI Zehui ,  

ZHANG Lin ,  

SHAN Xianying ,  

SHEN Ganjie ,  

摘要

Um das Problem der unzureichenden mehrskaligen zeitlichen Modellierung und der lokalen Merkmalmodellierung bei der Videozusammenfassung zu lösen, schlägt dieser Artikel ein Videozusammenfassungsmodell vor, das mehrskalige zeitliche Verschiebung mit einem verformbaren lokalen Aufmerksamkeitsmechanismus kombiniert. Zunächst wurde ein mehrskaliges adaptives bidirektionales Zeitverschiebungsmodul (MAB-TSM) entwickelt, das durch lernbares dynamisches Verschiebungsschritt-Vorhersage und mehrskalige dilatierte Faltung eine adaptive Modellierung von kurz- und langfristigen zeitlichen Abhängigkeiten des Videos ermöglicht; zweitens wurde ein verformbares lokales Aufmerksamkeitsmodul (DALAM) entworfen, das eine dynamische Video-Segmentierungsstrategie mit einem adaptiven Abtastpositionsanpassungsmechanismus kombiniert, wodurch die Rechenkomplexität reduziert und gleichzeitig die feinkörnige Merkmalsdarstellung der lokalen Schlüsselbereiche verstärkt wird; außerdem wurde das BiFPN-Netzwerk zur skalenübergreifenden Fusion verbessert, indem auf Basis von BiFPN ein skalenübergreifendes Aufmerksamkeitsverstärkungsmodul eingeführt wurde, das die komplementäre Darstellung mehrskaliger Merkmale verbessert. Das vorgeschlagene Modell wurde mehrfach auf den Datensätzen SumMe und TVSum getestet und erreichte im Standardmodus F1-Werte von 56,8 % und 62,6 %, was besser ist als bestehende Methoden, und die Kendall- und Spearman-Rangkorrelationskoeffizienten erreichten 0,153 bzw. 0,200, was eine gute Konsistenz zeigt. Die experimentellen Ergebnisse bestätigen die Genauigkeit und Wirksamkeit des Modells bei der Videozusammenfassung.

关键词

Videozusammenfassung;mehrskalige zeitliche Modellierung;Zeitverschiebungsmodul;verformbare Aufmerksamkeit;lokaler Aufmerksamkeitsmechanismus

阅读全文

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website