语音运动的3D无标记追踪,精确度低于毫米
Austin Lovell1, James Liu2, Arielle Borovsky3
1Department of Computer Science, Purdue University, West Lafayette, IN, United States.
bioRxiv : the preprint server for biology
|February 24, 2025
概括
一个新的无标记器系统使用集成的人工智能模型精确地跟踪成人和儿童的3D语音运动. 这项技术在没有物理传感器的情况下提供了亚毫米精度,推动了语音研究.
科学领域:
- 计算语言学计算语言学
- 生物医学工程 生物医学工程
- 在语音科学中的机器学习应用.
背景情况:
- 精确测量复杂的语音运动对于可理解的沟通至关重要.
- 传统的基于传感器的方法来追踪口腔发音器对某些人群来说是侵入性的和具有挑战性的,比如幼儿.
- 无标记面部地标跟踪显示出希望,但缺乏经过验证的3D精度和准确性,特别是对于儿科语音.
研究的目的:
- 开发和验证一种新的,无标记的3D语音运动跟踪方法.
- 评估综合系统的精度和准确性,将其与现有方法进行比较.
- 确定系统在跟踪成人和幼儿的语音运动中的有效性.
主要方法:
- 开发了一个新的框架,将形状保存面部标志与图形注意网络 (SPIGA) 集成,用于标志检测和CoTracker,基于变压器的模型,用于密集点跟踪.
- 通过评估3D跟踪精度 (标准偏差) 和准确性 (根平均平方误差与电磁关节图) 来验证方法.
- 评估成年参与者和幼儿 (3岁和4岁) 的表现.
主要成果:
- 与单独的SPIGA (≈ 0.35 mm SD) 相比,集成的SPIGA和CoTracker方法实现了更高的精度 (≈ 0.15 mm SD).
- 3D跟踪的准确性与电磁关节学 (≈0.29毫米RMSE) 相当.
- 该系统在跟踪成人和幼儿的语音运动方面表现相似.
结论:
- 新型无标记框架为3D语音运动跟踪提供了毫米以下的精度和准确性,适合不同年龄组.
- 这种开源的综合方法提高了可访问性,并降低了语音分析的计算成本.
- 该研究作为一种概念验证,通过模型集成改进生物学和神经科学中的无标记追踪应用.


