非流动的合成目标语言数据改善神经机器翻译
IEEE transactions on pattern analysis and machine intelligence
|November 17, 2023
概括
通过在多语言框架内使用非流利的目标句子来改进用于神经机器翻译的合成数据的生成. 这种方法提高了翻译性能,稳定性,并减少了幻觉.
科学领域:
- 自然语言处理自然语言处理.
- 机器翻译 机器翻译
- 人工智能的人工智能
背景情况:
- 神经机器翻译 (NMT) 模型需要大型并行体来进行有效的训练.
- 当并行数据稀缺时,数据增强技术,如生成合成并行句子,至关重要.
- 当前的方法通常假设合成数据必须模仿域内并行体,可能限制性能.
研究的目的:
- 调查非流利的合成目标句对NMT性能的影响.
- 在多语言的NMT框架内提出一种使用非流合成数据的新方法.
- 评估这种方法在各种资源场景中的有效性.
主要方法:
- 生成非流利目标侧面的合成并行句子.
- 将这些合成句子集成到一个多语言的NMT系统中,将它们视为来自另一种语言的数据.
- 对最先进的合成数据生成方法进行比较实验.
主要成果:
- 提出的方法在10个低资源和4个高资源任务中始终提高了翻译性能.
- 与现有的最先进的合成数据生成技术相比,观察到性能增长.
- 这些改进与最初的培训群体大小无关.
结论:
- 非流利的合成训练数据可以在多语言环境中使用时提高NMT性能.
- 这种方法导致更强大的NMT系统,不太容易受到域转移和幻觉的影响.
- 这些发现挑战了假设合成数据必须严格遵守目标侧流动性以获得最佳结果的假设.
更多相关视频
10:15Utilizing Repetitive Transcranial Magnetic Stimulation to Improve Language Function in Stroke Patients with Chronic Non-fluent Aphasia
Published on: July 2, 2013
17.9K
09:09Foreign Accent and Forensic Speaker Identification in Voice Lineups: The Influence of Acoustic Features Based on Prosody
Published on: September 27, 2024
464
