一种基于学习的高效方法,用于使用基准数据集进行自动记录脱复制
M Ravikanth1, Sampath Korra2, Gowtham Mamidisetti3
1Department of CSE, Malla Reddy University, Maisammaguda, Kompally, Hyderabad, India. drravikanthm.cse@mallareddyuniversity.ac.in.
Scientific reports
|July 15, 2024
概括
本研究引入了基于深度学习的增强记录去重复 (EDL-RD) 框架,以有效地消除重复数据. 新方法显著提高了数据集成和资源优化方面的性能.
科学领域:
- 计算机科学 计算机科学
- 数据科学数据科学数据科学
背景情况:
- 企业管理大量的数据用于商业智能 (BI).
- 来自多个来源的数据集成往往导致重复记录,阻碍性能和资源优化.
- 准确地消除重复记录对于可靠的数据管理系统至关重要.
研究的目的:
- 提出基于深度学习的增强记录去重复 (EDL-RD) 框架,以提高性能.
- 扩展现有的深度学习模型 (如Deep ER) 对于结构化数据去重复的功能.
- 开发一种高效的算法来解决大型数据集中的重复实体.
主要方法:
- 利用长短期记忆 (LSTM) 的一种变体来实现基于学习的记录去重复.
- 整合了各种属性组合,相似度指标和数值/零值解析技术.
- 开发了一种名为Efficient Learning based Record Deduplication (ELbRD) 的算法,扩展了参考模型.
主要成果:
- 拟议的EDL-RD框架与现有方法相比,表现优越.
- 经验研究证实了增强深度学习方法的有效性.
- ELbRD算法成功地解决了消除重复记录的挑战.
结论:
- 根据EDL-RD框架,基于深度学习的记录重复删除取得了重大进展.
- 拟议的改进导致更可靠的数据集成和优化资源利用.
- 这项研究为企业环境中管理重复数据提供了强大的解决方案.


