使用机器学习和深度学习方法检测哈萨克语中的攻击性内容
Milana Bolatbek1, Moldir Sagynay1, Shynar Mussiraliyeva1
1Department of Cybersecurity and Cryptology, Al-Farabi Kazakh National University, Almaty, Kazakhstan.
PeerJ. Computer science
|September 24, 2025
概括
这项研究开发了有效的机器学习模型,以检测社交媒体上的哈萨克语有害内容. 这项研究强调了对形态丰富语言的专用自然语言处理 (NLP) 工具的需求.
科学领域:
- 计算语言学 计算语言学
- 人工智能的人工智能
- 社交媒体分析 社交媒体分析
背景情况:
- 社交媒体平台在检测极端主义和网络欺凌等破坏性内容方面面临挑战.
- 标准的自然语言处理 (NLP) 模型往往不适合像哈萨克语这样的形态丰富的语言.
- 迫切需要专门的工具来确保在哈萨克斯坦数字空间的在线安全.
研究的目的:
- 适应和应用机器学习和深度学习技术来检测哈萨克语中的破坏性内容.
- 解决哈萨克语的语言复杂性,包括其聚合结构和丰富的形态学.
- 为了提高在线安全的内容分类的准确性和有效性.
主要方法:
- 利用机器学习算法,包括后勤回归和支持向量机 (SVM).
- 采用深度学习技术,例如长期短期记忆 (LSTM) 网络.
- 结合n-gram特性和机器学习的干部方法,以进行增强的分类.
主要成果:
- 在分类哈萨克语破坏性内容方面取得了高准确性.
- 证明了整合n-gram和steming与机器学习方法的有效性.
- 在哈萨克斯坦文本数据上验证了适应NLP模型的性能.
结论:
- 开发特定语言的NLP工具对于处理哈萨克语的复杂性至关重要.
- 该研究为在资源较少的语言中检测有害内容提供了一个成功的框架.
- 调查结果有助于加强在线安全和打击哈萨克语社区的数字极端主义.
