Мультимодальная семантическая сегментация изображений на основе механизма внимания

ZHANG Ji-you ,  

ZHANG Rong-fen ,  

LIU Yu-hong ,  

YUAN Wen-hao ,  

摘要

В настоящее время многие модели семантической сегментации используют тренировочные данные в виде RGB-изображений. В некоторых экстремальных условиях стабильность моделей значительно ухудшается, что не удовлетворяет требованиям автономного вождения в ночных условиях. Для решения задачи семантической сегментации ночных сцен была использована сеть ResNet-152 в качестве извлекателя признаков, построена мультимодальная модель с двойным энкодером-декодером и лёгким внимательным модулем. Двойной энкодер извлекает ключевую информацию из двух модальностей — RGB и T, объединяет их через модуль внимания, затем передаёт извлечённые признаки в декодер. На различных стадиях объединяются карты признаков после повышения разрешения и карты признаков из разных уровней энкодера, далее признаки извлекаются свёрточными слоями, разрешение восстанавливается через повышение масштабирования, и в конце выполняется семантическая сегментация. Экспериментальные результаты показывают, что средняя точность и индекс пересечения по тестовому набору MFNet составляют 76% и 55.7% соответственно, что улучшает показатели по сравнению с другими сетевыми моделями и удовлетворяет основным требованиям точной семантической сегментации сцен RGB-T при дневном и ночном освещении.

关键词

ночная семантическая сегментация; мультимодальность; лёгкий модуль внимания; многомасштабная информация

阅读全文

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website