在社交媒体上识别阿拉伯方言:一个混合模型与变压器模型和BiLSTM
1Department of Information Technology, Faculty of Computing and Information Technology, Northern Border University, Rafha, 91911, Saudi Arabia.
Heliyon
|September 19, 2024
概括
本研究介绍了社交媒体上的阿拉伯方言识别 (ADI) 的混合变压器模型. 将BiLSTM与CAMELBERT和ALBERT相结合的模型实现了高精度,提高了ADI性能.
科学领域:
- 自然语言处理自然语言处理.
- 计算语言学 计算语言学
- 人工智能的人工智能
背景情况:
- 阿拉伯方言识别 (ADI) 由于语言多样性而复杂.
- 现有的方法在社交媒体上与区域阿拉伯语变化的细微差别作斗争.
研究的目的:
- 通过基于变压器的混合模型在社交媒体上增强阿拉伯方言识别 (ADI).
- 介绍一个新的,大规模的ADI数据集,涵盖四个主要的阿拉伯方言.
主要方法:
- 提出了两个混合型号:双向长期短期存储器 (BiLSTM) 与CameLBERT和BiLSTM与AlBERT.
- 开发了一个新的数据集,包含埃及,约旦,海湾和也门方言的121,289条社交媒体评论.
- 使用基线机器学习分类器 (MLC) 和深度学习模型 (DLM) 进行实验.
主要成果:
- 与基线相比,混合模型在ADI中表现出优异的性能.
- 使用BiLSTM的CameLBERT获得了87.67%的准确率,使用BiLSTM的AlBERT获得了86.51%的准确率.
- 二元分类分析确定了方言的接近性.
结论:
- 混合变压器模型显著改善了社交媒体上的阿拉伯方言识别.
- 提出的模型为在NLP应用中处理各种阿拉伯方言提供了强大的解决方案.
- 这一新型数据集有助于进一步研究ADI.


