Метод генерации изображений из текста на основе самоконтролируемого внимания и слияния признаков изображения

LIAO Yonghui ,  

ZHANG Haitao ,  

JIN Haibo ,  

摘要

Существующие иерархические методы генерации изображений из текста на начальном этапе генерации изображения используют только операция увеличения разрешения для извлечения признаков, при этом процесс увеличения - по сути сверточная операция, ограничения которой приводят к игнорированию глобальной информации и невозможности взаимодействия отдалённых семантических данных. Хотя существуют методы с внедрением механизма самовнимания в модель, всё ещё присутствуют проблемы потери деталей изображения и структурных ошибок. В ответ на перечисленные проблемы предложена генеративно-состязательная сеть SAF-GAN, основанная на самоконтролируемом внимании и слиянии признаков изображения. Модуль самоконтроля, основанный на ContNet, добавлен на этап первоначальной генерации признаков; с помощью механизма внимания проводится автономное обучение отображения между признаками изображения, посредством контекстных связей признаков направляется динамическая матрица внимания, достигается тесное объединение контекстного извлечения и обучения самовниманию, что улучшает генерацию признаков изображений низкого разрешения. Далее посредством поочерёдного обучения сетей на разных этапах достигается детализированная генерация изображений высокого разрешения. Также добавлен модуль усиления слияния признаков, позволяющий объединять признаки низкого разрешения предыдущего этапа модели с текущими, обеспечивая генеративной сети полноценное использование высокосемантической информации низкоуровневых признаков и высокоразрешающей информации высокоуровневых признаков, что обеспечивает семантическое согласование признаков различных разрешений и, следовательно, реалистичную генерацию изображений высокого разрешения. Экспериментальные результаты показывают улучшения по показателям IS и FID по сравнению с базовой моделью (AttnGAN): на датасете CUB повышение IS на 0.31 и снижение FID на 3.45; на датасете COCO повышение IS на 2.68 и снижение FID на 5.18. Модель SAF-GAN способна эффективно генерировать более реалистичные изображения, что подтверждает эффективность метода.

关键词

компьютерное зрение; генеративно-состязательные сети; генерация изображений из текста; CotNet; слияние признаков изображения

阅读全文

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website