在犯罪文本分类中评估基于BERT的阿拉伯语和低资源语言的模型
Njood K Al-Harbi1, Manal Alghieth1
1Department of Information Technology, College of Computer, Qassim University, Buraydah, Saudi Arabia.
PeerJ. Computer science
|September 24, 2025
概括
来自变压器的双向编码器表示 (BERT) 对阿拉伯语和低资源语言NLP任务有希望. 本研究分析了BERT模型的性能和数据的可用性,并提供了未来的研究方向.
科学领域:
- 自然语言处理 (NLP) 是一种自然语言处理.
- 人工智能的人工智能
- 计算语言学 计算语言学
背景情况:
- 变压器的双向编码器表示 (BERT) 对于文本分类是有效的,因为它具有上下文理解.
- 包括BERT在内的转换器在刑事数据分类中越来越多地用于执法.
- 现有的BERT模型主要支持英语和中文等高资源语言,对阿拉伯语和其他低资源语言的选择有限.
研究的目的:
- 分析阿拉伯语言的基于BERT的模型的可用性和性能.
- 由于对阿拉伯语的研究有限,将分析扩展到其他资源较低的语言.
- 将BERT模型与传统的机器学习 (ML) 和深度学习 (DL) 方法进行比较.
主要方法:
- 针对阿拉伯语和其他资源较少的语言量身定制的基于BERT的模型的评估.
- 与ML,DL和其他变压器模型进行比较分析.
- 对低资源语言的数据可用性的评估.
主要成果:
- 关于BERT在低资源环境中的表现的经验统计证据.
- 与其他方法相比,基于BERT的模型的有效性.
- 在低资源语言中识别NLP的挑战和机会.
结论:
- 基于BERT的模型显示了在阿拉伯语和其他低资源语言中进行NLP任务的潜力.
- 需要进一步的研究来改善数据可用性和模型性能.
- 提供了关于该领域未来研究方向的建议.
