对多类不平衡数据集分类中的过量采样技术的审查:对医疗问题的见解
Yuxuan Yang1, Hadi Akbarzadeh Khorshidi1,2, Uwe Aickelin1
1School of Computing and Information Systems, The University of Melbourne, Parkville, VIC, Australia.
Frontiers in digital health
|August 12, 2024
概括
本综述考察了多类不平衡数据集的过量采样方法,这对于人工智能 (AI) 在健康信息学中至关重要. 混合重新采样方法正在成为应对这些复杂挑战的最有效方法.
科学领域:
- 机器学习 机器学习
- 数据科学数据科学数据科学
- 医疗信息学 医疗信息学
背景情况:
- 具有不平衡数据的多类分类对预测模型构成重大挑战.
- 现有的研究往往侧重于二进制分类,使多类不平衡不够解决,特别是在健康信息学中.
- 在多类场景中,在保留类间关系的同时生成合成数据是复杂的.
研究的目的:
- 审查和分析专门为多类不平衡数据集设计的过量采样方法.
- 识别新出现的趋势和有效的策略来解决多类数据不平衡的问题.
- 提供选定的研究的全面概述,并建议未来的研究方向.
主要方法:
- 系统的文献搜索确定了2076篇同行评审论文.
- 选择和深入分析37项符合条件的关于多类不平衡数据的研究.
- 将被审查的研究分类为指标性,适应性,基于结构的和混合方法.
主要成果:
- 观察到对混合重新采样方法的显著趋势.
- 混合方法有效地结合了各种技术来解决多类失衡.
- 该审查对方法进行了分类,提供了对其优缺点的见解.
结论:
- 混合过量采样方法在改善多类不平衡数据集的AI性能方面非常有前途.
- 需要进一步的研究来完善和开发先进的混合技术.
- 解决多类不平衡对于推进医疗保健及其他领域的人工智能应用至关重要.
更多相关视频
12:18A Machine Learning Approach to Design an Efficient Selective Screening of Mild Cognitive Impairment
Published on: January 11, 2020
7.5K
06:55Inverse Probability of Treatment Weighting Propensity Score using the Military Health System Data Repository and National Death Index
Published on: January 8, 2020
14.4K
