通过使用混合 RoBERTa 和元数据增强的 XGBoost 模型改进虚假新闻检测
Armughan Ali1,2, Zeeshan Haider1,3, Hooria Shahbaz2
1Department of Electrical Engineering, Wah Engineering College, University of Wah, Wah Cantt, 47040, Pakistan.
Scientific reports
|December 4, 2025
概括
这项研究引入了一个新的虚假新闻检测框架,将先进的语言模型与机器学习相结合. 该方法显著提高了在线识别欺骗性内容的准确性.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 自然语言处理自然语言处理.
背景情况:
- 在线虚假信息构成了重大的社会挑战,影响公众论和稳定.
- 传统的假新闻检测方法与欺骗性内容的不断变化的性质作斗争.
- 深度学习和NLP为增强假新闻分类提供了有希望的解决方案.
研究的目的:
- 提出一个新的假新闻分类框架.
- 将基于变压器的特征提取与XGBoost分类器集成,以改进检测.
- 为了捕捉语言和上下文的线索,准确地分类欺骗性内容.
主要方法:
- 使用 RoBERTa 嵌入式进行特征提取.
- 基于使用术语频率-反向文档频率 (TF-IDF) 的代币化.
- 集成的元数据处理与深度学习功能一起.
- 在PolitiFact和GossipCop数据集上训练和评估模型.
主要成果:
- 实现了最先进的准确性:PolitiFact上的0.9930和GossipCop上的0.9764
- 与现有方法相比,在精度,回忆和F1得分方面取得了显著的改进.
- 验证了框架在不同数据集中识别假新闻的有效性.
结论:
- 将深度学习特征提取与集体学习 (XGBoost) 结合起来,可以提高虚假新闻检测的稳定性.
- 拟议的框架为打击在线虚假信息提供了一个可扩展的解决方案.
- 有效地检测假新闻需要整合多种数据源和先进的NLP技术.
