奥努巴德:一个全面的数据集,用于将孟加拉地区方言自动转换为标准孟加拉方言
Nusrat Sultana1,2, Rumana Yasmin1,3, Bijon Mallik4,2
1Department of Computer Science and Engineering, Jahangirnagar University, Dhaka, Bangladesh.
一个新的数据集,ONUBAD,解决了孟加拉语方言在自然语言处理 (NLP) 中缺乏资源的问题. 它可以使用神经机器翻译 (NMT) 将奇塔贡,西尔赫特和巴里萨尔方言自动翻译成标准孟加拉语.
科学领域:
- 计算语言学 计算语言学
- 自然语言处理 (NLP) 是一种自然语言处理.
- 方言学是一种方言学.
背景情况:
- 对于标准孟加拉语在NLP中存在重大研究,但资源赤字阻碍了区域方言的发展.
- 孟加拉语的区域方言 (Chittagong,Sylhet,Barisal) 呈现出独特的语法和语音,经常挑战标准孟加拉语说者和NLP模型.
- 这些方言有时被认为是不同的语言,需要专门的资源来准确处理.
研究的目的:
- 推出ONUBAD,这是一个大型,免费可用的数据集,用于将孟加拉地区方言自动翻译成标准孟加拉语.
- 支持开发神经机器翻译 (NMT) 系统,用于资源不足的孟加拉语方言.
- 通过一个全面的平行语库来弥合标准和非标准的孟加拉语形式之间的差距.
主要方法:
- 创建一个平行语料库,包括1540个单词,130个句子和980个句子,每个方言 (奇塔贡,西尔赫特,巴里萨尔) 有标准孟加拉语和英语翻译.
- 包含详细介绍语音变化和每个方言特有的语法特征的元数据.
- 从各种来源 (书籍,网站,区域演讲者) 收集数据,并在2024年7月至9月期间进行专家咨询.
主要成果:
- 开发ONUBAD数据集,这是孟加拉语方言NLP的一个重要资源.
- 为区域孟加拉语方言提供一个并行集体,使NMT模型培训成为可能.
- 对方言特定的语言特征的记录,以提高翻译准确度.
结论:
- ONUBAD数据集是推动孟加拉语方言NLP研究的关键资源.
- 它有助于为资源不足的语言变异创建更准确,更符合上下文的翻译模型.
- ONUBAD支持语言保护工作,并促进数字语言技术的包容性.
更多相关视频
11:09An Analytical Tool-box for Comprehensive Biochemical, Structural and Transcriptome Evaluation of Oral Biofilms Mediated by Mutans Streptococci
Published on: January 25, 2011
11:09RBDT: A Computerized Task System based in Transposition for the Continuous Analysis of Relational Behavior Dynamics in Humans
Published on: July 17, 2021
相关概念视频
Gene Conversion
Conversion of Alcohols to Alkyl Halides
Improving Translational Accuracy
Regioselectivity and Stereochemistry of Hydroboration
Hydroboration proceeds in a concerted fashion with the attack of borane on the π bond, giving a cyclic four-centered transition state. The –BH2 group is bonded to the less substituted carbon and –H to the more substituted carbon. The concerted nature requires the simultaneous addition of –H and –BH2 across the same face of the alkene giving syn...
Master Transcription Regulators
Electrophilic Aromatic Substitution: Sulfonation of Benzene
