Segmentación semántica de imágenes multimodales basada en mecanismo de atención

ZHANG Ji-you ,  

ZHANG Rong-fen ,  

LIU Yu-hong ,  

YUAN Wen-hao ,  

摘要

Muchos modelos actuales de segmentación semántica utilizan datos de entrenamiento basados en imágenes RGB. En algunos entornos extremos, la estabilidad del modelo se ve muy afectada y no cumple con las necesidades reales de la conducción autónoma nocturna. Para resolver el problema de segmentación semántica en escenas nocturnas, se utilizó ResNet-152 como red de extracción de características y se construyó un modelo multimodal de doble codificador-decodificador que integra un módulo de atención ligero. El doble codificador extrae información clave de las modalidades RGB-T y las fusiona a través del módulo de atención, luego las características extraídas se envían al decodificador, donde se concatenan las características de las etapas de remuestreo con las de cada capa del codificador, se extraen características mediante capas convolucionales, se restaura la resolución mediante remuestreo y finalmente se realiza la segmentación semántica. Los resultados experimentales muestran que la precisión promedio y el índice de intersección sobre unión (IoU) en el conjunto de prueba MFNet son del 76% y 55.7% respectivamente, representando una mejora en comparación con otros modelos de red y cumpliendo con los requerimientos básicos para segmentación semántica precisa de imágenes RGB-T en escenas diurnas y nocturnas.

关键词

Segmentación semántica nocturna; multimodal; módulo de atención ligero; información multiescala

阅读全文

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website