在Instagram上检测COVID-19波斯语错误信息:机器学习和深度学习方法的比较分析
Mohammad Javad Shayegan1, Elahe Moradi Pirbalouti1, Mo Saraee2
1Faculty of Engineering, Department of Computer Engineering University of Science and Culture Tehran Iran.
Healthcare technology letters
|December 4, 2025
概括
这项研究对Instagram上的波斯语COVID-19错误信息检测进行了基准测试. 长短期记忆 (LSTM) 模型实现了最高的准确性,为非英语社交媒体分析建立了新的性能基准.
科学领域:
- 计算语言学 计算语言学
- 社交媒体分析 社交媒体分析
- 公共卫生信息学 公共卫生信息学
背景情况:
- 社交媒体的错误信息,特别是在Instagram等平台上,对公众的信任和健康构成风险.
- 现有的关于检测错误信息的研究主要以英语为中心,在其他语言中留下了一个空白.
- 在Instagram上用波斯语检测COVID-19错误信息对于公共卫生干预至关重要.
研究的目的:
- 建立一个性能基准来检测Instagram上的波斯语错误信息.
- 为错误信息分析创建和利用波斯语评论的新型数据集.
- 为此任务评估各种机器学习和深度学习模型.
主要方法:
- 与COVID-19相关的27,000个波斯语Instagram评论的数据集被策划和标记.
- 他们使用了五种模型:XGBoost (TF-IDF),LSTM (GloVe),CNN,KNN和BERT.
- 模型接受了培训和验证,以评估性能并防止过拟合,使用混矩阵进行评估.
主要成果:
- 长期短期记忆 (LSTM) 模型表现出卓越的性能.
- LSTM的准确度为0.97,精度为0.91,回忆率为0.85,F1得分为0.85.
- 培训和验证曲线证实了LSTM模型在减轻过度装配方面的有效性.
结论:
- 本研究提出了第一个高性能基线,用于基于深度学习的错误信息检测波斯社交媒体内容.
- LSTM模型提供了一个强大的解决方案,用于识别Instagram上的波斯语COVID-19错误信息.
- 调查结果强调了开发多语言方法来打击在线虚假信息的重要性.
