Método de generación de imágenes a partir de texto basado en autoatención supervisada y fusión de características de imagen

LIAO Yonghui ,  

ZHANG Haitao ,  

JIN Haibo ,  

摘要

Los métodos jerárquicos actuales para la generación de imágenes a partir de texto utilizan solo la sobremuestreo para la extracción de características en la fase inicial de generación de imágenes. El proceso de sobremuestreo es esencialmente una operación de convolución, y las limitaciones de la convolución causan que se ignore la información global y que no se produzca interacción semántica a larga distancia. Aunque existen métodos que incorporan el mecanismo de autoatención en el modelo, aún persisten problemas como la pérdida de detalles de la imagen y errores estructurales en la imagen. Para abordar estos problemas, se propone un modelo de red generativa adversaria basado en la autoatención supervisada y la fusión de características de imagen llamado SAF-GAN. Se añade un módulo de auto supervisión basado en ContNet en la fase inicial de generación de características, utilizando el mecanismo de atención para el aprendizaje autónomo del mapeo entre características de la imagen, guiando la matriz de atención dinámica a través de las relaciones contextuales de las características, logrando una alta integración del minado contextual y el aprendizaje de autoatención, mejorando la generación de características de imágenes de baja resolución. Posteriormente, mediante un entrenamiento alternante de la red en diferentes fases, se logra una generación refinada de imágenes de alta resolución. También se añadió un módulo de mejora de fusión de características que combina las características de baja resolución de la etapa anterior con las características de la etapa actual, permitiendo a la red generativa aprovechar plenamente la alta información semántica de las características de bajo nivel y la información de alta resolución de las características de alto nivel, garantizando una mayor coherencia semántica entre mapas de características de diferentes resoluciones, logrando así la generación de imágenes realistas de alta resolución. Los resultados experimentales muestran que, en comparación con el modelo de referencia (AttnGAN), el modelo SAF-GAN mejora los índices IS y FID, con un aumento de 0.31 en IS y una disminución de 3.45 en FID en el conjunto de datos CUB; un aumento de 2.68 en IS y una disminución de 5.18 en FID en el conjunto de datos COCO. El modelo SAF-GAN puede generar imágenes más realistas de manera efectiva, demostrando la efectividad de este método.

关键词

visión por computadora; redes generativas adversarias; generación de imágenes a partir de texto; CotNet; fusión de características de imagen

阅读全文

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website