一个哈萨克语的数据集,是指令识别的唇部动作
Batyr Kenzheakhmetov1, Alissultan Amankos1, Beibut Amirgaliyev2
1School of Artificial Intelligence and Data Science, Astana IT University, 010001, Astana, Kazakhstan.
Scientific data
|December 3, 2025
概括
研究人员开发了一种新的哈萨克斯坦唇读体,以改进语音识别技术. 这种视觉数据库有助于理解语言和发音变异,以获得更好的唇读系统.
科学领域:
- 计算机科学 计算机科学
- 语言学的语言学.
- 语音技术 语言技术
背景情况:
- 嘴唇阅读系统以视觉方式解释语音,当音频无法使用时至关重要.
- 有效的口唇阅读模型需要专门的身体来捕捉语言和视觉发音的变化.
- 现有的资源可能无法充分代表像哈萨克语这样的多种语言.
研究的目的:
- 介绍一个专门用于哈萨克斯坦口唇阅读的新型视觉体.
- 促进开发更准确的哈萨克斯坦唇读技术.
- 支持多式联络语音识别领域的研究.
主要方法:
- 收集了26名参与者的视频录像,这些参与者的年龄范围广泛.
- 专注于102个常见的哈萨克名词,具有独特的发音模式.
- 产生了大约34,000个视频剪辑,总计120万.
主要成果:
- 创建了一个全面的,注释的视觉语料库,用于哈萨克斯坦的唇读.
- 该集体捕捉了大量的语言和发音多样性.
- 数据库是技术进步的宝贵资源.
结论:
- 新的哈萨克斯坦唇读体对于改善语音识别至关重要.
- 这个资源将推动视觉语音处理的进一步研究.
- 它有望增强多式联络语音识别应用程序.


