基于光学字符识别的SMS骗局检测应用程序用于图像数据使用无监督和深度半监督学习
Anjali Shinde1, Essa Q Shahra1, Shadi Basurra1
1Faculty of Computing, Engineering and Built Environment, Birmingham City University, Birmingham B4 7RQ, UK.
Sensors (Basel, Switzerland)
|September 28, 2024
概括
这项研究通过开发一个模型来通过机器学习和深度学习来识别smishing消息来增强垃圾邮件检测. 该KNN-Flatten模型实现了94.13%的准确性,提供了改进的实时检测能力.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 网络安全 网络安全
背景情况:
- 不被请求的短信,称为smishing,以及数据的不规则性构成了重大安全挑战.
- 现有的垃圾邮件检测方法往往忽视了文本,图像和文本在smishing攻击中的复杂相互作用.
- 需要先进的模型,能够有效地分析这些多方面的关系.
研究的目的:
- 开发和评估一个复杂的模型来检测Smishing消息.
- 探索将传统机器学习和深度学习技术用于垃圾邮件检测的有效性.
- 分析词语,图像和情境因素之间的关系,以识别smishing.
主要方法:
- 将UCI垃圾邮件数据集与真实世界的垃圾邮件数据合并,使用光学字符识别 (OCR) 进行图像分析.
- 使用传统的机器学习模型 (K-means,NMF,GMM) 与特征提取 (TF-IDF,PCA).
- 使用深度学习模型 (RNN-Flatten,LSTM,Bi-LSTM) 来捕捉顺序依赖和上下文细微差别.
主要成果:
- 通过向量化器进行K-means特征提取,获得了91.01%的准确性.
- 该KNN-Flatten模型表现出卓越的性能,达到94.13%的准确性.
- 对比分析强调了机器学习和深度学习方法在垃圾邮件检测中的优势.
结论:
- 由于其高精度,KNN-Flatten模型显示了实时粉碎检测的巨大潜力.
- 虽然有效,但KNN-Flatten等先进模型的计算复杂性可能会影响大规模部署.
- 带有向量化器的K-means提供了良好的准确性,但可能需要持续重新训练以适应不断变化的smishing战术.


