一个半监督的方法,以阿拉伯方面类别检测使用伯特和老师-学生模型
Miada Almasri1, Norah Al-Malki2, Reem Alotaibi1
1Information Technology Department/Faculty of Computing and Information Technology, King Abdulaziz University, Jeddah, Saudi Arabia.
PeerJ. Computer science
|June 22, 2023
概括
这项研究引入了一种半监督的噪音学生方法,以改善阿拉伯语方面类别检测,增强AraBERT模型,以更好地分析酒店评论中的情绪.
科学领域:
- 自然语言处理自然语言处理.
- 机器学习 机器学习
- 情绪分析 情绪分析
背景情况:
- 基于方面的情感分析研究在英语中广泛,但在阿拉伯语中有限,特别是在方面类别检测方面.
- 现有的方法通常依赖于监督学习和大型标记数据集,对阿拉伯语等资源稀缺的语言构成挑战.
研究的目的:
- 实施半监督的自我训练,杂的学生框架,以增强阿拉伯语的方面类别检测.
- 为了提高AraBERT v02深度学习模型的性能,使用这个关于酒店评价数据集的框架.
主要方法:
- 一个由四个步骤组成的框架,包括在标记数据上训练的教师模型,未标记数据的伪标签生成,在组合数据上训练的噪音学生模型和模型组合.
- 使用了SemEval 2016酒店评价数据集和Hotel Arabic-Reviews数据集 (HARD) 2016,处理了大约100万个句子.
主要成果:
- 组装的教师-学生模型显示,相对于最初的噪音学生实施的方面类别预测,微F1的改进率为0.3%.
- 与教师模型相比,微型F1的增长率达到了1%,超过了基线和其他深度学习模型.
结论:
- 拟议的半监督杂学生框架有效地提高了阿拉伯语方面类别检测能力.
- 合并的AraBERT模型表现出卓越的性能,解决了阿拉伯语基于方面情绪分析的研究缺口.


