在可穿戴增强现实中实现实时语音分离和脱声的强大双线框架
Alon Nemirovsky1, Gal Itzhak1, Israel Cohen1
1Andrew and Erna Viterbi Faculty of Electrical & Computer Engineering, Technion-Israel Institute of Technology, Haifa 3200003, Israel.
Sensors (Basel, Switzerland)
|September 13, 2025
概括
这项研究引入了可穿戴增强现实 (AR) 设备的新音频增强框架. 它通过分离源和减少回声来提高噪音环境中的语音清晰度,使AR体验更强大.
科学领域:
- 音频信号处理 音频信号处理
- 增强现实系统 增强现实系统
- 声学工程 声学工程
背景情况:
- 可穿戴增强现实 (AR) 设备需要在动态声学环境中进行强大的音频处理.
- 实时语音增强对于有效的AR用户交互至关重要.
- 现有的方法在AR场景中扎着本地化错误和反响.
研究的目的:
- 开发一种低复杂度,实时的双线框架,用于在AR中进行语音源分离和脱声.
- 为了提高对到达方向 (DOA) 估计错误的稳定性,使用感兴趣区域 (ROI) 射线变频器.
- 引入多限制束形设计,以改善源隔离和降低噪音.
主要方法:
- 一个用于实时语音增强的双线框架.
- 实施一个感兴趣的区域 (ROI) 光束变量器,以解决DOA估计错误.
- 开发一种多约束束束形成方法,同时保护或抑制源.
- 使用语音增强增强现实 (SPEAR) 挑战数据集和现实世界的记录进行验证.
主要成果:
- 基于ROI的方向盘显著提高了对定位错误的稳定性,同时保持了噪音和反响抑制.
- 投资回报光束成型引入了从所需和不需要的来源增加的高频泄漏.
- 多限制束形增强了源隔离,降低了噪声抑制.
- 综合框架证明了实时音频增强的实际效率.
结论:
- 拟议的双线框架与ROI和多约束束梁成型提供了一个有效的解决方案,用于实时音频增强可穿戴AR.
- ROI光束转换器提高了AR头部运动中固有的局部化不准确性的稳定性.
- 多限制设计为在AR音频场景中管理多个声音源提供了灵活性.


