用神经网络检测网络鱼URL:一个实证研究
Hayk Ghalechyan1, Elina Israyelyan1, Avag Arakelyan1
1EasyDMARC, Data Science, 0014, Yerevan, Armenia.
Scientific reports
|October 25, 2024
概括
这项研究引入了一种新的概率神经网络方法来分类网络鱼URL,达到97%的准确性. 机器学习模型成功地将公共和私人数据集成到现实世界的生产环境中.
科学领域:
- 计算机科学 计算机科学
- 网络安全 网络安全
- 人工智能的人工智能
背景情况:
- 网络鱼网站通过模仿合法网站窃取敏感数据而构成重大威胁.
- 准确的URL分类对于网络安全防御至关重要.
- 现有的方法需要改进,以打击复杂的网络鱼策略.
研究的目的:
- 开发和评估用于URL分类的先进的人工智能和机器学习模型.
- 引入一种独特的概率神经网络方法,以改进网络鱼URL检测.
- 证明在生产环境中,在联合开源和私有数据集上训练的机器学习模型的有效性.
主要方法:
- 确定性和概率神经网络模型用于URL分类的应用.
- 开发一种使用概率神经网络的新方法.
- 创建一个综合数据集,将开源 (Alexa,PhishTank,OpenPhish) 和私人生产数据 (EasyDMARC) 结合起来.
- 在没有第三方依赖的情况下进行特征工程.
主要成果:
- 通过每日模型验证,在验证数据集上平均达到97%的准确性.
- 证明了在生产环境中在混合数据集上训练的机器学习模型的成功.
- 评估了确定性和概率模型,在所有长度的URL上显示了高准确度.
结论:
- 概率神经网络为URL分类准确性提供了改进的方法.
- 在各种数据集上训练的机器学习模型对于现实世界的网络鱼检测是有效的.
- 开发的模型提供了一个强大的解决方案,用于识别短和长的网络鱼URL.


