一种基于规则的混合NLP和机器学习方法用于在财务文件中检测和匿名化PII
Kushagra Mishra1, Harsh Pagare1, Kanhaiya Sharma2
1Department of Computer Science & Engineering, Symbiosis Institute of Technology, Constituent of Symbiosis International (Deemed University), Pune, Maharashtra, India.
Scientific reports
|July 2, 2025
概括
本研究引入了一种使用NLP和ML的混合方法,用于检测和匿名化财务文件中的个人身份信息 (PII),显著改善数据保护和合规性.
科学领域:
- 计算机科学 计算机科学
- 数据安全 数据安全
- 自然语言处理自然语言处理.
背景情况:
- 财务文件包含敏感的个人身份信息 (PII),需要强有力的保护.
- 数据泄露和违规行为对金融机构构成重大风险.
- 现有的个人信息匿名化方法可能缺乏可扩展性和准确性.
研究的目的:
- 开发和评估一种可扩展的混合方法,用于在财务文件中检测和匿名化个人信息.
- 加强金融数据的安全性和监管合规性.
- 改进目前在运营金融环境中用于PII保护的方法.
主要方法:
- 整合基于规则的自然语言处理 (NLP),机器学习 (ML) 和定制的命名实体识别 (NER) 模型.
- 创建一个多样化的合成数据集,模仿真实的财务文件,用于培训和验证.
- 使用混矩阵,ROC曲线和精度回忆曲线进行全面的模型评估.
主要成果:
- 混合模型在合成数据上获得了94.7%的精度,89.4%的回忆率和91.1%的F1分数.
- 合成数据集的整体准确率为89.4%,实际财务文件的准确率为93%.
- 该模型展示了通过严格的性能指标验证的强大的概括能力.
结论:
- 拟议的混合方法为金融文件中的PII匿名化提供了强大而高效的解决方案.
- 这种方法显著提高了在运营金融结算中的敏感信息的保护.
- 这些发现支持采用先进的NLP和ML技术,以提高数据安全性和合规性.

