一个基于多顺序声学模拟的预训练框架,用于重播语音伪造检测.
Changhwan Go1, Nam In Park2, Oc-Yeub Jeon2
1Department of Computer Engineering, Chosun University, Gwangju 61452, Republic of Korea.
Sensors (Basel, Switzerland)
|August 26, 2023
概括
本研究引入了一种新的预培训框架,使用多顺序声学模拟来改进自动扬声器验证系统中的重播语音伪造检测. 与传统方法相比,拟议的方法显著提高了准确性和F1得分.
科学领域:
- 语音处理 语音处理
- 机器学习是机器学习.
- 网络安全 网络安全
背景情况:
- 自动扬声器验证 (ASV) 系统容易受到语音伪造攻击,包括重播攻击.
- 由于物理记录要求,现有的深度学习对策在重复攻击的数据集创建方面面临挑战.
- 重复攻击涉及通过各种方式模仿用户的声音,这构成了重大安全风险.
研究的目的:
- 提出一个使用多顺序声学模拟的预培训框架,以有效检测重播语音伪造.
- 为了克服数据集构建的局限性,用于重复伪造对策.
- 提高深度学习模型在识别基于重复播放的语音伪造方面的性能.
主要方法:
- 开发了一种使用清洁语音和室内冲动响应 (RIR) 数据集的多顺序声学模拟框架.
- 生成模拟音频数据,表示清洁信号,原始扬声器配置和重播攻击配置.
- 采用预训练策略对模拟音频进行分类,然后对现有的重播语音伪造数据集进行微调.
主要成果:
- 拟议的预训练方法实现了高精度98.16%和F1得分95.08%的高精度.
- 这与传统方法相比显著改进,该方法获得了92.94%的准确性和86.92%的F1分数.
- 多级声学模拟有效地捕获了与重播攻击相关的各种声学配置.
结论:
- 拟议的多顺序声学模拟预培训框架对于重播语音伪造检测非常有效.
- 这种方法为训练重复攻击对策提供了一个可行的解决方案,解决了数据稀缺问题.
- 增强的性能证明了模拟声环境在加强ASV系统安全方面的潜力.


