Метод генерации изображений по тексту, объединяющий XLnet и DMGAN

ZHAO Zewei ,  

CHE Jin ,  

LÜ Wenhan ,  

摘要

Поскольку текстовый энкодер в задаче генерации изображений по тексту не может глубоко извлекать информацию из текста, что приводит к семантической несовместимости сгенерированных изображений, в данной статье предложен улучшенный метод генерации изображений по тексту на основе модели DMGAN. Сначала текст кодируется с помощью предварительно обученной модели XLnet, которая благодаря тренировке на крупном корпусе может захватывать большое количество априорных знаний текста, обеспечивая глубокое извлечение контекстной информации; затем на начальном и этапе уточнения изображений модели DMGAN добавляется модуль внимания к каналам, выделяющий важные каналы признаков, что дополнительно улучшает семантическую согласованность и пространственную структуру генерируемых изображений, а также скорость сходимости и стабильность модели. Результаты экспериментов показывают, что по сравнению с исходной моделью DMGAN на наборе данных CUB предложенная модель улучшила показатель IS на 0.47 и снизила показатель FID на 2.78, что подтверждает лучшую кросс-модальную генеративную способность модели.

关键词

генерация изображений по тексту;модель XLnet;генеративно-состязательная сеть;внимание к каналам

阅读全文

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website