在网络流量中模糊的恶意软件检测和分类利用混合大型语言模型和合成数据
Mehwish Naseer1, Farhan Ullah2, Samia Ijaz3
1Computer and Software Engineering Department, College of Electrical and Mechanical Engineering, National University of Sciences and Technology (NUST), Islamabad 44080, Pakistan.
Sensors (Basel, Switzerland)
|January 11, 2025
概括
本研究介绍了Syn-detect,这是一种使用大型语言模型 (LLM) 进行Android恶意软件检测的新型智能传感模型. 它有效地对基于网络流量的威胁进行分类,通过生成合成数据和利用BERT进行分析来实现高精度.
科学领域:
- 网络安全 网络安全
- 移动安全 移动安全
- 人工智能的人工智能
背景情况:
- 由于操作系统的普及,Android恶意软件构成重大威胁.
- 现有的恶意软件分析方法因隐私问题而面临数据稀缺的挑战.
- 网络流量分析对于检测Android应用程序中的恶意组件至关重要.
研究的目的:
- 提出一个新的智能传感模型,Syn-detect,用于Android恶意软件的检测和分类.
- 在恶意软件分析中应对有限的网络流量数据的挑战.
- 利用大型语言模型 (LLM) 进行增强的恶意软件分类.
主要方法:
- 一个两步的方法:使用GPT-2生成合成的TCP恶意软件流量,并使用微调的双向编码器表示从变压器 (BERT) 模型对恶意软件进行分类.
- 利用BERT进行代币化,文字嵌入生成和网络流量数据的分类.
- 在CIC-AndMal2017和CIC-AAGM2017安卓恶意软件数据集上测试Syn-detect模型.
主要成果:
- Syn-detect实现了高精度,在CIC-AndMal2017上达到99.8%,在CIC-AAGM2017上达到99.3%.
- 马修的相关系数 (MCC) 值为CIC-AndMal2017的99%和CIC-AAGM2017的98%,表明了强大的预测性能.
- 该模型在Android恶意软件分类中表现优于现有的方法.
结论:
- Syn-detect模型在对基于网络流量的Android恶意软件进行分类方面表现强.
- 使用LLM,包括GPT-2用于数据合成和BERT用于分类,证明在克服数据稀缺挑战方面是有效的.
- Syn-detect在移动安全和Android恶意软件检测研究方面提供了一个有前途的进步.


