基于改进的Mask R-CNN的元素检测和数学函数图的细分.
Jiale Lu1, Jianjun Chen1, Taihua Xu1
1School of Computer Science, Jiangsu University of Science and Technology, Zhenjiang 212100, Jiangsu, China.
Mathematical biosciences and engineering : MBE
|July 28, 2023
概括
本研究引入了一种改进的Mask R-CNN模型,用于将数学函数图形转换为触觉图形,从而提高视力障碍者的可访问性. 新模型显著提高了检测和细分图形元素的准确性,有助于理解科学内容.
科学领域:
- 计算机视觉 计算机视觉
- 辅助技术 辅助技术 辅助技术
- 科学可视化科学可视化
背景情况:
- 全球超过22亿人患有视力障碍,其中许多人依赖非视觉感官.
- 目前面向视障人士的触觉图形和阅读材料不足以满足对图形内容理解的需求.
- 目前的触觉图形翻译方法面临由于图像多样性和识别技术限制的局限性.
研究的目的:
- 通过数学函数的触觉图形,使视障人士能够更好地理解自然科学.
- 开发一种先进的模型,用于准确有效地识别和细分函数图形元素.
- 加强电子格式的创建,以从数学函数中产生触觉图形.
主要方法:
- 提出了一个MA Mask R-CNN模型,包含MA ConvNeXt用于特征提取和MA BiFPN用于特征融合.
- 开发了新的MA ConvNeXt和MA BiFPN网络以改善特征表示.
- 整合了注意力机制,结合了本地,全球和道信息,以加强对不同目标的检测.
主要成果:
- 在函数图形实例分割中,MA Mask R-CNN模型实现了目标检测的89.6%的mAP和目标细分的72.3%的mAP.
- 与原始的Mask R-CNN相比,在目标检测mAP中显示出9%的改进,在目标细分mAP中显示出12.8%的改进.
- 该模型通过使用多尺度特征,有效地提高了细型和多类型目标的检测能力.
结论:
- MA Mask R-CNN模型为视力受损者提供了从数学函数生成触觉图形的显著进步.
- 这项技术有可能改善视力障碍者在教育和科学方面的可访问性.
- 进一步的研究可以探索该模型在将复杂的视觉数据转换为可访问格式的更广泛的应用.


