Text-zu-Bild-Generierungsmethode basierend auf selbstüberwachter Aufmerksamkeit und Bildmerkmalsfusion

LIAO Yonghui ,  

ZHANG Haitao ,  

JIN Haibo ,  

摘要

Bestehende hierarchische Methoden zur Text-zu-Bild-Generierung verwenden in der Anfangsphase der Bildgenerierung nur Upsampling zur Merkmalsextraktion. Der Upsampling-Prozess ist im Wesentlichen eine Faltungsoperation, deren Einschränkungen dazu führen, dass globale Informationen ignoriert werden und entfernte semantische Interaktionen nicht möglich sind. Obwohl bereits Methoden existieren, die Mechanismen der Selbstaufmerksamkeit im Modell integrieren, bestehen weiterhin Probleme mit fehlenden Bilddetails und strukturellen Bildfehlern. Zur Lösung der genannten Probleme wird ein generatives gegnerisches Netzwerkmodell SAF-GAN vorgeschlagen, das auf selbstüberwachter Aufmerksamkeit und Bildmerkmalsfusion basiert. Ein selbstüberwachtes Modul basierend auf ContNet wird in die Phase der Initialisierung der Merkmalsgenerierung eingebunden, wobei der Aufmerksamkeitsmechanismus zur autonomen Abbildung zwischen Bildmerkmalen genutzt wird. Durch kontextuelle Beziehungen der Merkmale wird eine dynamische Aufmerksamkeitsmatrix gesteuert, was eine hohe Kombination aus Kontextabbau und selbstüberwachtem Aufmerksamkeitslernen ermöglicht und die Generierungseffekte von niedrig aufgelösten Bildmerkmalen verbessert. Anschließend wird durch abwechselndes Training der Netzwerke in verschiedenen Phasen eine verfeinerte Hochauflösungsbildgenerierung erreicht. Zudem wird ein Modul zur Merkmalsfusion hinzugefügt, das niedrig aufgelöste Merkmale der vorherigen Phase mit aktuellen Merkmalen kombiniert, sodass das generative Netzwerk hoch semantische Informationen der unteren Merkmalsebene und hochauflösende Informationen der oberen Merkmalsebene voll ausnutzen kann. Dies gewährleistet eine größere semantische Konsistenz zwischen Merkmalskarten unterschiedlicher Auflösungen und ermöglicht so die realistische Erzeugung hochauflösender Bilder. Experimentelle Ergebnisse zeigen Verbesserungen bei den IS- und FID-Metriken im Vergleich zum Basismodell (AttnGAN), mit einer Steigerung des IS um 0,31 und einer Senkung des FID um 3,45 beim CUB-Datensatz; einer Steigerung des IS um 2,68 und einer Senkung des FID um 5,18 beim COCO-Datensatz. Das SAF-GAN-Modell kann effektiv realistischere Bilder generieren und bestätigt damit die Wirksamkeit der Methode.

关键词

Computervision; Generative Adversarial Networks; Text-zu-Bild-Generierung; CotNet; Bildmerkmalsfusion

阅读全文

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website