通过整合改进的MECT模型,研究一种用于识别和解释中文argot的框架
Mingfeng Li1, Xin Li1,2, Mianning Hu1
1School of Information and Network Security, People's Public Security University of China, Beijing 102206, China.
Entropy (Basel, Switzerland)
|April 26, 2024
概括
本研究介绍了使用词向量和大型语言模型来解码地下行业论点的新方法. 这些进步有助于执法部门通过改进语法识别和解释来检测非法活动.
科学领域:
- 计算语言学 计算语言学
- 人工智能的人工智能
- 犯罪学 犯罪学
背景情况:
- 地下行业使用专门的口号进行秘密通信和逃避监视.
- 现有的解密这些论据的方法对于执法部门来说是不够的.
研究的目的:
- 开发和评估用于识别和解释特定行业论点的新框架.
- 为执法部门提供加强的技术支持,打击非法活动.
主要方法:
- 利用词向量和大型语言模型 (LLM) 来分析参数中的语义差异.
- 开发了一个标记argot数据集 (MNGG).
- 使用MECT,LLMs,提示工程和DBSCAN集群创建了一个语法识别框架 (CSRMECT) 和一个解释框架 (LLMResolve).
主要成果:
- 与最佳模型相比,CSRMECT框架在MNGG数据集上的argot识别上提高了F1得分10%.
- 该LLMResolve框架在语解释方面实现了4%的更高准确度.
- 确定了矢量信息和模型性能之间的潜在相关性.
结论:
- 拟议的CSRMECT和LLMResolve框架在语法识别和解释方面提供了显著的改进.
- 这些人工智能驱动的工具可以增强执法部门发现和处理非法活动的能力.
- 词向量中的信息可能是模型性能的一个关键因素.


