طريقة توليد الصور من النص باستخدام XLnet وDMGAN

ZHAO Zewei ,  

CHE Jin ,  

LÜ Wenhan ,  

摘要

نظرًا لأن مشفر النص في مهمة توليد الصور من النص لا يمكنه استخراج المعلومات النصية بعمق، مما يؤدي إلى عدم اتساق دلالي في الصور الناتجة لاحقًا، اقترحت هذه الورقة طريقة توليد الصور من النص محسنة على نموذج DMGAN. أولاً، يتم ترميز النص باستخدام نموذج XLnet المدرب مسبقًا، الذي يمكنه التقاط الكثير من المعرفة المسبقة للنصوص بفضل التدريب على مجموعة بيانات ضخمة، مما يحقق استخراجًا عميقًا لمعلومات السياق؛ ثم في مرحلتي البداية وتنقية الصور في نموذج DMGAN، يتم إضافة وحدة انتباه القنوات، مع إبراز قنوات الخصائص الهامة، لتعزيز اتساق المعنى والتخطيط المكاني合理的生成图像的合理性,以及提升模型的收敛速度和稳定性。实验结果表明,在CUB数据集上,所提出的模型相比原始的DMGAN模型,IS指标提升了0.47,FID指标降低了2.78,这充分说明该模型具有更好的跨模态生成能力。

关键词

توليد الصور من النص;نموذج XLnet;الشبكة التنافسية التوليدية;انتباه القنوات

阅读全文

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website