Método de generación de imágenes a partir de texto que fusiona XLnet y DMGAN

ZHAO Zewei ,  

CHE Jin ,  

LÜ Wenhan ,  

摘要

Dado que el codificador de texto en la tarea de generación de imágenes a partir de texto no puede extraer profundamente la información textual, lo que conduce a problemas de inconsistencia semántica en las imágenes generadas posteriormente, este artículo propone un método mejorado de generación de imágenes a partir de texto basado en el modelo DMGAN. Primero se utiliza el modelo preentrenado XLnet para codificar el texto, que bajo el preentrenamiento en un gran corpus puede captar una gran cantidad de conocimiento previo del texto, logrando una extracción profunda de la información contextual; luego, en la etapa inicial de generación de imágenes y en la etapa de refinamiento del modelo DMGAN se añade un módulo de atención de canales, destacando los canales de características importantes, mejorando aún más la coherencia semántica y la racionalidad de la disposición espacial de las imágenes generadas, así como la velocidad de convergencia y estabilidad del modelo. Los resultados experimentales muestran que, en comparación con el modelo DMGAN original en el conjunto de datos CUB, el modelo propuesto mejora el índice IS en 0,47 y reduce el índice FID en 2,78, lo que demuestra plenamente que el modelo tiene una mejor capacidad de generación multimodal.

关键词

generación de imágenes a partir de texto;modelo XLnet;red generativa antagónica;atención de canal

阅读全文

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website