Méthode de génération d'images à partir de texte fusionnant XLnet et DMGAN

ZHAO Zewei ,  

CHE Jin ,  

LÜ Wenhan ,  

摘要

Étant donné que l'encodeur de texte dans la tâche de génération d'images à partir de texte ne peut pas extraire profondément l'information textuelle, entraînant une incohérence sémantique dans les images générées ultérieurement, cet article propose une méthode améliorée de génération d'images à partir de texte basée sur le modèle DMGAN. Tout d'abord, le texte est encodé à l'aide du modèle pré-entraîné XLnet, qui, grâce à un entraînement sur un grand corpus, peut capturer une grande quantité de connaissances a priori du texte, réalisant ainsi une extraction profonde des informations contextuelles ; ensuite, dans les phases initiale et de raffinage des images du modèle DMGAN, un module d'attention de canal est ajouté pour mettre en avant les canaux de caractéristiques importants, améliorant ainsi la cohérence sémantique, la rationalité de la disposition spatiale des images générées, ainsi que la vitesse de convergence et la stabilité du modèle. Les résultats expérimentaux montrent que, comparé au modèle DMGAN d'origine sur le jeu de données CUB, le modèle proposé améliore l'indice IS de 0,47 et réduit l'indice FID de 2,78, démontrant pleinement la meilleure capacité de génération cross-modale du modèle.

关键词

génération d'images à partir de texte;modèle XLnet;réseau antagoniste génératif;attention de canal

阅读全文

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website