基于离散单位的藏语-中文语音翻译
Zairan Gong1, Xiaona Xu2, Yue Zhao1
1Key Laboratory of Ethnic Language Intelligent Analysis and Security Governance of MOE, Minzu University of China, Beijing, 100081, China.
Scientific reports
|January 20, 2025
概括
本研究介绍了一种新的西藏-中文语音对语音翻译 (S2ST) 系统,使用自主监督学习和多任务学习. 这种方法甚至在有限的数据上也实现了有希望的翻译质量.
科学领域:
- 计算语言学 计算语言学
- 人工智能的人工智能
- 语音处理 语音处理
背景情况:
- 语音翻译 (S2ST) 从级联系统 (ASR,MT,TTS) 发展到端到端模型,这是由性能增长和更大的数据集推动的.
- 对藏语语音翻译的研究仍然有限,这对跨语言沟通构成了重大挑战.
研究的目的:
- 开发一个直接的藏文-中文语音-语音翻译系统.
- 为了应对藏语语音翻译研究中有限的数据可用性的挑战.
- 为了提高S2ST绩效,利用多任务学习和自我监督学习.
主要方法:
- 利用HuBERT自主监督学习 (SSL) 模型提取离散的语音单元.
- 开发了一个语音到单元翻译 (S2UT) 模型,采用编码器-解码器架构.
- 使用多任务学习与辅助任务来提高翻译效率.
- 使用电话单元规范化相互信息 (PNMI) 优化了HuBERT配置.
主要成果:
- 证明了直接西藏到中国S2ST的可行性.
- 实现了有前途的翻译质量和语义内容的保存.
- 在低资源的S2ST中验证了SSL和多任务学习的有效性.
结论:
- 提议的S2UT方法对于西藏到中文的语音翻译是有效的.
- 多任务学习在低资源的S2ST场景中显著提高了性能.
- 这项工作为未来对资源不足的语言语音翻译的研究铺平了道路.
更多相关视频
09:27Using Eye Movements Recorded in the Visual World Paradigm to Explore the Online Processing of Spoken Language
Published on: October 13, 2018
9.9K
08:32Examining Online Syntactic Processing of Spoken Complex Sentences in Chinese Using Dual-Modal Interference Tasks
Published on: September 5, 2019
5.6K
