孟加拉语新闻分类器:一种机器学习方法,用于孟加拉语报纸的新闻分类,使用混合堆叠分类器
Tanzir Hossain1, Ar-Rafi Islam1, Md Humaion Kabir Mehedi1
1Department of Computer Science and Engineering, BRAC University, Dhaka, Bangladesh.
PloS one
|June 9, 2025
概括
这项研究引入了先进的机器学习模型来对孟加拉语新闻文章进行分类,达到94%的准确性. 混合组合方法,特别是堆叠双向长短期记忆和支持矢量机,显著优于孟加拉自然语言处理的传统方法.
科学领域:
- 自然语言处理自然语言处理.
- 机器学习 机器学习
- 计算语言学 计算语言学
背景情况:
- 孟加拉语在线新闻的扩散需要先进的分类方法.
- 传统模型与孟加拉语数据集的复杂性和语言细微差别作斗争.
- 混合和深度学习技术有可能提高孟加拉文本分类的准确性.
研究的目的:
- 开发和评估机器学习和深度学习模型,将孟加拉语新闻文章分为八个类别.
- 为了比较传统算法,深度学习架构和混合模型的性能.
- 确定最有效的孟加拉新闻分类方法,解决低资源语言挑战.
主要方法:
- 利用了118,404篇孟加拉新闻文章的大数据集.
- 应用的特征提取技术:TF-IDF矢量化和word2Vec嵌入.
- 通过传统的机器学习,深度学习 (例如双向长期短期记忆) 和混合堆叠分类器进行了实验.
主要成果:
- 性能最好的模型是一个堆叠的元分类器,它结合了双向长短期内存和支持矢量机器,达到94%的准确性.
- 这种混合模型显著超过了单个基线模型的性能.
- 综合性绩效分析包括混矩阵,ROC曲线和错误分析.
结论:
- 汇集方法和深度学习,特别是拟议的堆叠分类器,对于孟加拉新闻分类非常有效.
- 这项研究证明了先进技术在低资源自然语言处理任务中的有效性.
- 这项研究为优化孟加拉文本分类系统提供了有价值的见解.
更多相关视频
07:35Selecting Multiple Biomarker Subsets with Similarly Effective Binary Classification Performances
Published on: October 11, 2018
7.4K
09:34A Virtual Machine Platform for Non-Computer Professionals for Using Deep Learning to Classify Biological Sequences of Metagenomic Data
Published on: September 25, 2021
3.9K
