一个合成数据集,用于比较反洗钱方法
Rasmus Ingemann Tuffveson Jensen1,2, Joras Ferwerda3, Kristian Sand Jørgensen4
1Department of Electrical and Computer Engineering, Aarhus University, Aarhus, 8200, Denmark. rasmus.tuffveson.jensen@ece.au.dk.
Scientific data
|September 28, 2023
概括
研究人员开发了SynthAML,这是针对反洗钱 (AML) 方法的合成数据集,解决了公共银行数据的缺乏问题. 这一数据集能够对洗钱防治技术进行可靠的基准测试,显示其在现实世界中的适用性.
科学领域:
- 金融犯罪学 金融犯罪学
- 数据科学数据科学数据科学
- 机器学习 机器学习
背景情况:
- 由于机密性,公开可用的银行交易数据集很少,这阻碍了反洗钱 (AML) 研究.
- 这种数据稀缺性限制了对反洗钱关键挑战的调查,例如效率,有效性,类不平衡,概念漂移和可解释性.
研究的目的:
- 引入SynthAML,一个新的合成数据集,旨在用于AML中的统计和机器学习方法的基准测试.
- 为推进反洗钱研究和开发提供一个现实的和可访问的资源.
主要方法:
- SynthAML是使用来自丹麦银行Spar Nord的真实数据生成的.
- 该数据集包括超过1600万笔交易和2万条反洗钱警报.
- 它作为评估各种AML算法的基准.
主要成果:
- 实验结果表明,在SynthAML上训练的机器学习模型表现出可转移到现实世界的场景中的性能.
- 该数据集有助于在反洗钱中研究效率,有效性,类失衡,概念漂移和可解释性.
结论:
- SynthAML有效地解决了AML研究中缺乏公共数据所带来的局限性.
- 合成数据集是开发和验证新的反洗钱战略和技术的宝贵工具.


