使用神经图像细分方法检测编辑过的文本
Ruben van Heusden1, Kaj Meijer1, Maarten Marx1
1Information Retrieval Lab, University of Amsterdam, Amsterdam, The Netherlands.
概括
这项研究引入了自动化方法来检测文档中的编辑,这对隐私和透明度至关重要. 面具R-CNN模型实现了高精度和回忆,即使在各种编辑类型和未编辑页面.
科学领域:
- 计算机科学 计算机科学
- 信息科学 信息科学 信息科学
- 数字法医学数字法医学
背景情况:
- 删除敏感信息是法律和公开披露环境中的标准做法.
- 自动编辑检测有助于分析编辑的普遍性和有效性.
研究的目的:
- 评估神经网络模型用于自动编辑检测.
- 将性能与基于规则的方法进行比较.
主要方法:
- 实施和测试Mask R-CNN和Mask2Former神经网络模型.
- 与使用光学字符识别和形态操作的基于规则的模型进行比较.
主要成果:
- 面膜R-CNN在各种数据集上表现出优异的性能,回忆率为0.94和精度为0.96.
- 当包括未删除的页面时,性能保持稳健,降解最小.
- Mask2Former对未删除的输入表现出最高的稳定性,产生较少的错误阳性.
结论:
- 神经网络方法,特别是Mask R-CNN,对于自动编辑检测是有效的.
- 开发的方法为文档分析和隐私审计提供了实际应用.
- 进一步的研究可以完善模型,在各种编辑技术中提高准确性和稳定性.


