在多模式视网膜图像上的自动标签清洗的效率和安全性
Tian Lin1,2, Meng Wang3, Aidi Lin1,2
1Joint Shantou International Eye Center, Shantou University and the Chinese University of Hong Kong, Shantou, Guangdong, 515041, China.
NPJ digital medicine
|January 5, 2025
概括
使用Cleanlab的自动标签清洁显著改善了医疗成像AI中的数据集质量和标签准确性. 这种方法有效地纠正错误,提高模型性能和可靠性.
科学领域:
- 人工智能的人工智能
- 医疗成像医学成像
- 数据科学数据科学数据科学
背景情况:
- 标签噪声是影响人工智能模型性能的一个关键挑战.
- 高质量的数据集对于医疗诊断中可靠的AI至关重要.
研究的目的:
- 用Cleanlab. 评估自动标签清洗的有效性和安全性.
- 评估标签清洁对多类医学成像数据集的影响.
- 制定减轻过度清理和确保数据完整性的策略.
主要方法:
- 利用开源的Cleanlab框架进行自动标签清洁.
- 在底部摄影和OCT数据集中引入了不同水平的标签噪声 (0-70%).
- 应用了六个自动清洗周期和DQS指导的策略.
- 在EyePACS和APTOS-2019数据集上进行了外部验证.
主要成果:
- 在标签准确度 (3.4-62.9%) 和数据集质量得分 (5.1-74.4%) 中取得了显著的改进.
- 成功纠正了86.6-97.5%的标签错误,错误分类最小.
- 在清洗后,RETFound的分类准确度提高了0.3-52.9%.
- 外部验证使标签准确度提高了1.3% (EyePACS) 和1.8% (APTOS-2019).
结论:
- 使用Cleanlab的自动标签清洁是医疗成像数据集的有效和安全方法.
- 这种方法提高了数据集的可靠性,并加强了AI模型的性能.
- 一个以DQS为指导的战略有效地减轻过度清洁的风险.


