Methode zur Bildgenerierung aus Text unter Einbeziehung von XLnet und DMGAN

ZHAO Zewei ,  

CHE Jin ,  

LÜ Wenhan ,  

摘要

Da der Textencoder bei der Aufgabe der Bildgenerierung aus Text den Text nicht tiefgehend erfassen kann, was zu semantischen Inkonsistenzen in den später generierten Bildern führt, wird in diesem Artikel eine verbesserte Methode zur Bildgenerierung aus Text auf Basis des DMGAN-Modells vorgeschlagen. Zunächst wird der Text mit dem vortrainierten XLnet-Modell codiert, das durch das Pretraining auf großen Korpora viel Vorwissen über Texte erfassen kann und eine tiefe Kontextinformationsextraktion ermöglicht; dann wird in der Anfangsphase der Bildgenerierung und in der Verfeinerungsphase des DMGAN-Modells ein Kanäle-Aufmerksamkeitsmodul hinzugefügt, das wichtige Merkmalskanäle hervorhebt und dadurch die semantische Konsistenz und die räumliche Anordnung der generierten Bilder sowie die Konvergenzgeschwindigkeit und Stabilität des Modells weiter verbessert. Experimentelle Ergebnisse zeigen, dass das vorgeschlagene Modell im Vergleich zum ursprünglichen DMGAN-Modell auf dem CUB-Datensatz den IS-Wert um 0,47 verbessert und den FID-Wert um 2,78 senkt, was die bessere multimodale Generierungsfähigkeit des Modells bestätigt.

关键词

Bildgenerierung aus Text;XLnet-Modell;Generatives Adversarielles Netzwerk;Kanalaufmerksamkeit

阅读全文

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website