Leichtgewichtige Video-Superauflösung basierend auf OFCA-Transformer

REN Pengyang ,  

PANG Kai ,  

摘要

Um die bestehenden Probleme bei Methoden zur Video-Superauflösung in komplexen Bewegungsszenen zu adressieren, wie ungenaue Zwischenbildausrichtung, unzureichende Nutzung zeitlicher Informationen und hohe Rechenkomplexität traditioneller Aufmerksamkeitsmechanismen, schlägt dieser Artikel ein Video-Superauflösungsnetzwerk mit optischem Fluss-gelenkter Kreuzaufmerksamkeit (OFCA-Transformer) vor. Zunächst wird ein leichtgewichtiges Multiskalen-Optical-Flow-Schätzmodul entworfen, das Bewegungsinformationen mit unterschiedlicher Granularität erzeugt; zweitens wird innovativ ein optischer Fluss-gelenkter Kreuzaufmerksamkeitsmechanismus eingeführt, bei dem ein lokales Aufmerksamkeitsfenster um die vorhergesagte Position des optischen Flusses aufgebaut wird, um eine tiefe Fusion von expliziten geometrischen Priorwissen und impliziter Inhaltswahrnehmung zu erreichen, wodurch die Ausrichtungsgenauigkeit verbessert und die Rechenkomplexität deutlich reduziert wird; abschließend wird ein gestuftes Merkmalsaggregationsmodul aufgebaut, um eine effektivere spatiotemporale Merkmalsfusion innerhalb der Transformer-Architektur zu realisieren. Bei Vergrößerungsfaktoren von ×2, ×3 und ×4 wird die vorgestellte Methode mit anderen Methoden auf drei öffentlichen Datensätzen verglichen. Die Ergebnisse zeigen, dass die PSNR-Werte von OFCA-Transformer auf mehreren Datensätzen nur um 0,16 dB von anderen fortschrittlichen Methoden abweichen, während die Anzahl der Modellparameter um 82,8 % reduziert wird, was die Recheneffizienz effektiv steigert. Darüber hinaus zeigt die vorgestellte Methode eine genauere Detailwiederherstellung und eine bessere zeitliche Konsistenz in komplex bewegten Szenen und erzielt objektiv bessere quantitative Messwerte bei allen Vergrößerungsfaktoren.

关键词

Video-Superauflösung;Transformer;Optical-Flow-Schätzung;Kreuzaufmerksamkeit;Bewegungsausrichtung

阅读全文

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website