可解释检测:一种基于变压器的语言建模方法,用于孟加拉新闻标题分类,并使用ML和DL进行比较可解释性分析.
Md Julkar Naeen1, Sourav Kumar Das1, Sakib Alam Jisan1
1Department of Computer Science and Engineering, Daffodil International University, Dhaka, Bangladesh.
Frontiers in artificial intelligence
|November 24, 2025
概括
这项研究使用像XLM-RoBERTa这样的深度学习模型来增强孟加拉文本分类,达到0.91准确度. 使用可解释的AI技术,包括LIME,以确保透明度和验证低资源语言的结果.
科学领域:
- 自然语言处理 (NLP) 是一种自然语言处理.
- 机器学习 (ML) 是指机器学习.
- 深度学习 (Deep Learning) 是一种深度学习.
背景情况:
- 由于分散的数据和噪音,孟加拉语文本分类存在挑战.
- 低资源语言需要专门的NLP方法来进行有效的文本分析.
研究的目的:
- 为了分类分散的孟加拉文本,专注于可解释性.
- 为了比较监督的ML模型,LSTM网络和孟加拉文本分类的变压器模型.
- 为透明的NLP解决方案整合可解释的AI (XAI) 技术.
主要方法:
- 数据集收集了近期的孟加拉语新闻文章,并进行了广泛的功能工程.
- 在孟加拉语数据集中处理噪声的预处理技术.
- 监督ML,LSTM和变压器模型的实施和比较 (XLM-RoBERTa基础).
- 整合LIME (局部可解释模型-不可知解释) 以实现模型可解释性.
主要成果:
- 在孟加拉语新闻标题分类中,XLM-RoBERTa Base实现了0.91的最高准确度.
- 可解释的人工智能技术成功识别了关键特征和加权词,验证了分类准确性.
- 深度学习模型显示了孟加拉文本分类的巨大潜力.
结论:
- 深度学习模型,特别是XLM-RoBERTa,对于孟加拉文本分类非常有效.
- 可解释的人工智能对于建立对低资源语言NLP应用程序的信任和透明度至关重要.
- 这项研究推进了孟加拉语的NLP能力,并强调了可解释AI的重要性.
