使用广谱特征和深度神经网络自动识别大熊猫的发声
Zhiwu Liao1,2, Shaoxiang Hu3, Rong Hou4
1Key Laboratory of Land Resources Evaluation and Monitoring in Southwest China, Ministry of Education, Sichuan Normal University, Chengdu, China.
Mathematical biosciences and engineering : MBE
|September 7, 2023
概括
研究人员为大熊猫 (GPs) 开发了一种自动语音识别系统. 这种新型的深度神经网络 (DNN) 在识别16个不同的GP发音类别时取得了超过95%的准确性.
科学领域:
- 生物声学是一种生物声学.
- 人工智能的人工智能
- 动物行为 动物行为
背景情况:
- 大熊猫 (GPs) 拥有复杂的声乐谱,对于它们的社会互动和行为至关重要.
- 准确的GP声调分类对于生态监测和保护工作至关重要.
- 现有的自动化系统往往缺乏必要的特征提取能力,以进行细微的生物声学分析.
研究的目的:
- 开发和验证用于识别大熊猫发声的自动化系统.
- 引入一种新的深度神经网络 (DNN) 架构,用于增强生物声学特征提取.
- 为了在分类各种大熊猫发声类别方面达到高准确度.
主要方法:
- 从成都大熊猫繁殖研究基地记录和标记了超过12,800个大熊猫声样.
- 开发了一个名为3Fbank-GRU的新型深度神经网络 (DNN).
- 使用Mel过器银行 (Fbank),中等Mel过器银行 (MFbank) 和反向Mel过器银行 (RFbank) 提取声学特征,以捕获低,中,高频率.
主要成果:
- 3Fbank-GRU模型在识别16个不同的大熊猫发声类别方面取得了超过95%的准确性.
- 该系统通过结合多频带特征,与传统方法相比,表现出更高的性能.
- 拟议的方法可以准确标记大熊猫发声的大规模数据集.
结论:
- 开发的自动语音识别系统对于大熊猫研究非常准确和有效.
- 3Fbank-GRU模型为危物种的生物声学分析提供了重大进展.
- 这项技术可以广泛应用于监测大熊猫种群,并通过被动声学记录来了解它们的行为.


