通过非平行 corpora 改进低资源语言的神经机器翻译:从埃及方言到现代标准阿拉伯语翻译的案例研究
Mohamed Atta Faheem1, Khaled Tawfik Wassif2, Hanaa Bayomi2
1Department of Computer Science, Faculty of Computers and Artificial Intelligence, Cairo University, Cairo, Egypt. m.atta@fci-cu.edu.eg.
Scientific reports
|January 27, 2024
概括
这项研究探讨了使用有限数据将像埃及语这样的低资源阿拉伯方言的半监督机器翻译翻译成现代标准阿拉伯语. 它评估了三个系统,包括无监督和半监督的方法,以提高翻译质量.
科学领域:
- 计算语言学 计算语言学
- 自然语言处理自然语言处理.
- 人工智能的人工智能
背景情况:
- 对于低资源语言的机器翻译面临着数据稀缺的挑战.
- 无监督学习提供了一个有希望的途径,通过减少对并行企业的依赖.
- 与现代标准阿拉伯语相比,阿拉伯方言,尤其是埃及方言,存在独特的翻译困难.
研究的目的:
- 研究埃及阿拉伯语到现代标准阿拉伯语的半监督神经机器翻译 (NMT).
- 用有限的并行和单语言数据评估不同的NMT方法的有效性.
- 为了比较监督,无监督和半监督的NMT系统用于方言阿拉伯语翻译.
主要方法:
- 利用了对齐的埃及阿拉伯语和现代标准阿拉伯语句子的并行数据集.
- 使用埃及阿拉伯单语言数据集,没有直接目标语言对齐.
- 开发并比较了三个NMT系统:基于注意力的序列对序列,无监督变压器和混合监督-无监督方法.
主要成果:
- 基于注意力的模型利用了共享的词汇来改善词语嵌入.
- 无监督变压器模型仅使用单语言数据证明了翻译能力.
- 混合系统将监督的预培训与随后的单语言数据集成相结合.
结论:
- 半监督和无监督的方法显示了低资源方言机器翻译的潜力.
- 方法的选择影响基于数据可用性的翻译性能.
- 进一步的研究可以优化这些方法,以获得更广泛的方言覆盖范围和更高的准确性.
更多相关视频
09:09Foreign Accent and Forensic Speaker Identification in Voice Lineups: The Influence of Acoustic Features Based on Prosody
Published on: September 27, 2024
457
10:15Utilizing Repetitive Transcranial Magnetic Stimulation to Improve Language Function in Stroke Patients with Chronic Non-fluent Aphasia
Published on: July 2, 2013
17.8K
