构建一个用于室内场景识别和语义细分的多尺度特征融合模型
Jing Wen Li1,2, Guan Wen Yan1,2, Jian Wu Jiang3,4
1College of Geomatics and Geoinformation, Guilin University of Technology, Guilin, 541006, China.
Scientific reports
|April 27, 2025
概括
本研究介绍了一种用于快速室内场景识别和语义细分的双任务模型. 该模型实现了高精度和处理速度,优于导航和个性化服务的现有方法.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 机器人技术 机器人技术 机器人技术
背景情况:
- 精确提取多层次的语义信息对于室内应用,如导航和个性化服务至关重要.
- 现有的方法往往难以同时处理大规模场景类别和小规模元素语义.
研究的目的:
- 为联合室内场景识别和语义细分提出一个高效的基于RGB的双任务模型.
- 调查功能融合策略和最佳训练以提高性能.
主要方法:
- 采用金字塔聚合的双任务模型,具有共享的功能层.
- 场景识别分支与SE注意力和变压器模块.
- 语义分段分支融合ResNet50低级特征,用于详细的纹理和形状学习.
主要成果:
- 在场景识别和语义细分组合中实现了98.4%的整体准确性.
- 在语义细分方面获得了82.6%的整体准确度.
- 演示了每场景大约0.037秒的处理速度,超过了最先进的模型.
结论:
- 拟议的双任务模型有效地提取室内应用的多尺度语义信息.
- 最佳的单任务培训策略对双任务准确性产生了积极的影响.
- 两项任务的平衡损失权重为1,产生了最好的整体模型性能.


