开源手动注释声道数据库用于使用深度学习从3DMRI进行自动细分:比较2D和3D卷积和变压器网络:深度学习:比较2D和3D卷积和变压器网络
Subin Erattakulangara1, Karthika Kelat1, Katie Burnham2
1Roy J. Carver Department of Biomedical Engineering, University of Iowa, Iowa City, Iowa.
概括
深度学习模型,特别是带有转移学习的3D U-Net,显示了来自3D MRI的自动声道细分的前景,提高了语音和语音研究的效率和准确性.
科学领域:
- 医疗成像医学成像
- 人工智能的人工智能
- 语音科学 语言科学
背景情况:
- 精确的声道细分从3DMRI对于声音,言语和歌唱应用至关重要.
- 手动细分是耗时且容易出现错误的,需要自动化解决方案.
研究的目的:
- 从3DMRI数据评估深度学习算法对自动声道细分的有效性.
- 为了比较不同深度学习架构在声道细分方面的性能.
主要方法:
- 评估了四种深度学习架构:2D切片式U-Net,3D U-Net,3D U-Net与转移学习,3D变压器U-Net (3D U-NetR).
- 使用了来自10名法语发言者的53个声道卷的数据集,手动注释作为参考细分.
- 性能被评估使用子系数,豪斯多夫距离和结构相似度指数.
主要成果:
- 3D U-Net和3D U-Net与转移学习实现了最高的子系数 (0.896).
- 转移学习模型的性能与3D U-Net相比,使用的训练数据较少,Hausdorff距离的变化较低.
- 所有模型都在与特定的声音 (如 /kõn/) 和骨区域附近的细分扎;然而,口腔喉和喉喉空间通常被准确地细分.
结论:
- 3D卷积网络,特别是具有转移学习的3D卷积网络,对于3DMRI的自动声道细分是有效的.
- 未来的研究应该旨在改善具有挑战性的声道配置和边界划分的细分.


