空间重建局部注意力Res2Net与F0子带用于假语音检测
Cunhang Fan1, Jun Xue1, Jianhua Tao2
1Anhui Province Key Laboratory of Multimodal Cognitive Computation, School of Computer Science and Technology, Anhui University, Hefei, 230601, China.
概括
本研究介绍了一种使用基本频率 (F0) 亚波段进行假语音检测 (FSD) 的新方法. 这种新的方法显著提高了检测准确性,在关键基准数据集上取得了最先进的结果.
科学领域:
- 语音处理 语音处理
- 人工智能的人工智能
- 信号分析 信号分析
背景情况:
- 合成语音往往缺乏真正的人类语言的自然节奏和基本频率 (F0) 变化.
- 基本频率 (F0) 是区分真语和合成语的关键特征.
- 现有的假语音检测 (FSD) 方法可能无法充分利用F0变异的歧视潜力.
研究的目的:
- 通过专注于基本频率 (F0) 亚波段,提出一种用于假语音检测 (FSD) 的新方法.
- 为了提高FSD性能,增强F0子带的建模.
- 为了在假语音检测方面取得最先进的结果.
主要方法:
- 为假语音检测 (FSD) 提出了一种新的F0子带方法.
- 引入了空间重建局部注意力Res2Net (SR-LA Res2Net) 架构,以有效地建模F0子带.
- Res2Net骨干提取多层次信息,通过空间重建来增强,以保存通道数据和专注于F0子带细节的本地注意力.
主要成果:
- 拟议的方法在ASVspoof 2019的LA数据集上实现了0.47%的等错率 (EER).
- 最小的双重检测成本函数 (min t-DCF) 达到0.0159.
- 与其他单一系统相比,该系统表现出了最先进的性能.
结论:
- 拟议的F0子带方法,利用SR-LA Res2Net,对于假语音检测 (FSD) 是非常有效的.
- 整合空间重建和局部注意力显著增强了F0特征的建模.
- 取得的结果代表了虚假语音检测领域的重大进步.


