Méthode de génération d’images à partir de texte basée sur l’auto-attention supervisée et la fusion des caractéristiques d’image

LIAO Yonghui ,  

ZHANG Haitao ,  

JIN Haibo ,  

摘要

Les méthodes hiérarchiques actuelles de génération d’images à partir de texte utilisent uniquement l’up-sampling pour l’extraction des caractéristiques lors de la phase initiale de génération d’image. Le processus d’up-sampling est essentiellement une opération de convolution, et les limitations de la convolution entraînent une négligence des informations globales ainsi qu’une incapacité à interagir avec la sémantique distante. Bien que certaines méthodes intègrent des mécanismes d’auto-attention dans le modèle, des problèmes tels que la perte de détails dans l’image et les erreurs structurelles persistent. Pour répondre à ces problèmes, un modèle génératif antagoniste SAF-GAN basé sur l’auto-attention supervisée et la fusion des caractéristiques d’image est proposé. Un module d’auto-supervision basé sur ContNet est intégré à la phase de génération des caractéristiques initiales, utilisant le mécanisme d’attention pour un apprentissage autonome de la cartographie entre les caractéristiques d’image. Grâce aux relations contextuelles des caractéristiques, une matrice d’attention dynamique est guidée afin d’atteindre une haute synergie entre l’exploration contextuelle et l’apprentissage d’auto-attention, améliorant ainsi l’efficacité de génération des caractéristiques des images basse résolution. Par la suite, une génération affinée des images haute résolution est réalisée par un entraînement alterné des réseaux à différentes phases. Un module de renforcement de fusion de caractéristiques est également ajouté : en fusionnant les caractéristiques basse résolution de la phase précédente du modèle avec celles de la phase actuelle, le réseau génératif peut pleinement exploiter l’information sémantique élevée des caractéristiques de bas niveau et l’information haute résolution des caractéristiques de haut niveau, garantissant une cohérence sémantique entre les cartes de caractéristiques de différentes résolutions, ce qui permet la génération d’images haute résolution réalistes. Les résultats expérimentaux montrent qu’en comparaison avec le modèle de référence (AttnGAN), le modèle SAF-GAN présente des améliorations sur les indices IS et FID, avec une augmentation de 0,31 en IS et une diminution de 3,45 en FID sur le dataset CUB; une augmentation de 2,68 en IS et une diminution de 5,18 en FID sur le dataset COCO. Le modèle SAF-GAN génère efficacement des images plus réalistes, ce qui prouve l’efficacité de cette méthode.

关键词

vision par ordinateur; réseaux antagonistes génératifs; génération d’images à partir de texte; CotNet; fusion des caractéristiques d’image

阅读全文

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website