使用TitaNet,MarbelNet和时间延迟网络进行扬声器日记化的增强深度学习方法
Muzamil Ahmed1, Riad Alharbey2, Ali Daud3
1Department of Computer Science, Namal University, Mianwali, 42210, Pakistan.
Scientific reports
|July 8, 2025
概括
这项研究介绍了Neuro-TM Diarizer,这是一个深度学习框架,可以提高说话者日记的准确性. 它在复杂的声学环境中明显优于传统方法,提高了关键指标的性能.
科学领域:
- 语音处理和信号分析
- 机器学习和人工智能的人工智能
- 计算语言学 计算语言学
背景情况:
- 扬声器日记对于语音转录,人工智能和音频分析至关重要,但传统方法与噪音和重叠语音作斗争.
- 现有的基于集群的方法在准确性和稳定性方面存在局限性,特别是在具有挑战性的声学条件下.
研究的目的:
- 引入一个新的深度学习框架,Neuro-TM Diarizer,以改善扬声器日记化.
- 通过整合降噪,自适应光束成形和神经日记来提高复杂声学环境中的性能.
主要方法:
- 开发了一个多式联网深度学习框架,结合了Marble-Net用于语音活动检测和Tita-Net用于扬声器嵌入.
- 使用时延神经网络进行神经日记和扬声器识别.
- 在VoxConverse和VoxCeleb数据集上评估了Neuro-TM日记者,并将其与基于集群的方法进行比较.
主要成果:
- 在VoxConverse上实现了6.89%的低日记错误率 (DER),在VoxCeleb上达到6.93%的低日记错误率.
- 与基于集群的方法相比,显著改进,在VoxConverse上减少了12.60%的DER,在VoxCeleb上减少了14.01%.
- 该框架有效处理噪音和重叠的语音,在准确性和稳定性方面超过传统方法.
结论:
- 拟议的Neuro-TM日记机在扬声器日记化技术方面取得了重大进展.
- 这种深度学习框架为现实应用提供了强大的解决方案,包括语音转录,语音认证和音频存档.
- 降噪和先进的神经网络架构的整合在复杂的声学场景中带来了卓越的性能.


