优化法医文件分类:通过βk超参数调整增强SFCS
D Paul Joseph1, Viswanathan Perumal2
1School of Computer Science Engineering and Information Systems, Vellore Institute of Technology University, Vellore, Tamilnadu, India.
PeerJ. Computer science
|March 26, 2025
概括
本研究介绍了SDOT法医分类系统 (SFCS),以改善法医文档分析中的主题建模. SFCS使用了一个新参数 (βk) 来增强主题相关性和分类准确性.
科学领域:
- 计算机科学 计算机科学
- 信息科学 信息科学 信息科学
- 法医科学 法医科学 法医科学
背景情况:
- 在法医分析中,传统的主题建模参数 (α,β,βj) 往往导致主题分布不足,稀疏和过度匹配.
- 现有的方法在数据偏和来自多种词对的噪音方面扎,限制了分类模型的融合.
- 当前主题建模方法可能会导致高时间复杂性的低效分类.
研究的目的:
- 提出SDOT法医分类系统 (SFCS),以解决法医专题建模的局限性.
- 根据语义和上下文相似性,引入一个新的功能参数 (βk) 来识别基于语义和上下文相似性的种子词.
- 为了提高文件分类在法医环境中的准确性和效率.
主要方法:
- 开发了SDOT法医分类系统 (SFCS),其中包含了一个新参数βk.
- 使用词载体的语义和上下文相似性来识别种子词.
- 集成的超参数优化和超平面最大化用于模型改进.
主要成果:
- 通过使用700个黑名单关键字,SFCS成功删除了278,000个无关文件,并识别了5,600个可疑文件.
- 实现了94.6%的文件分类精度,精度为94.4%,回忆率为96.8%.
- 通过优化参数集成,将时间复杂性降低到O ((n log n).
结论:
- 功能参数βk的SFCS有效地迫使话题分布模拟策划的种子词,产生相关的主题.
- 拟议的系统显著改善了法医机构中相关和可疑文件的识别.
- SFCS在准确性,精度和回忆方面表现出卓越的性能,并提高了法医文件分类的计算效率.


