一个特征工程数据集的良性和网络鱼URL用于机器学习和大型语言模型评估评估
Dam Minh Linh1, Tran Cong Hung2
1Information Security Technology Laboratory, and Faculty of Information Technology, Posts and Telecommunications Institute of Technology (PTIT), Ho Chi Minh, Vietnam.
Data in brief
|October 27, 2025
概括
一个包含111,660个URL的新数据集有助于检测网络鱼. 丰富了22个功能,它使机器学习 (ML) 和大型语言模型 (LLM) 在网络安全中的可重复性基准测试成为可能.
科学领域:
- 网络安全 网络安全
- 机器学习 机器学习
- 自然语言处理自然语言处理.
背景情况:
- 网络鱼网站构成了重大的网络安全威胁.
- 现有的数据集缺乏特征和平衡,阻碍了模型评估和可重复性.
- 机器学习 (ML) 和大型语言模型 (LLM) 显示出基于URL的网络鱼检测的前景.
研究的目的:
- 引入一个全面的,功能丰富的数据集,用于评估网络鱼检测模型.
- 为了促进可重复的研究和传统的ML和LLM基于的方法之间的公平比较.
- 支持开发强大且可扩展的网络安全解决方案.
主要方法:
- 策划了111,660个URL的数据集 (100,000个良性,11,660个网络鱼).
- 通过22个数值词汇和结构特征来丰富每个URL.
- 包括URL,域名,TLD和标签列用于解释性和分类.
主要成果:
- 评估随机森林 (RF) 和MiniLM-LLM与物流回归 (LR) 在数据集上.
- 在两种基线模型中都实现了>96%的准确性和>0.99的ROC AUC得分.
- 证明了数据集对于强大的网络鱼检测模型评估的实用性.
结论:
- 该数据集为可重复的网络鱼检测研究提供了有价值的基准.
- 它弥合了传统的ML和基于LLM的检测方法之间的差距.
- 促进对抗性稳定性和可扩展的安全模型的未来工作.
