医学图像细分模型的性能指标,在神经成像中通过不确定的,小的或空的参考注释进行监督
Sophie Ostmeier1, Brian Axelrod1, Fabian Isensee2
1Stanford University, Center of Academic Medicine, 453 Quarry Rd, Palo Alto, CA 94304, United States of America.
Medical image analysis
|September 6, 2023
概括
医疗图像细分的标准性能指标可能不准确地反映出临床实用性,特别是在不确定的或不完整的注释的情况下. 重新思考评估对于医疗保健中可靠的人工智能至关重要.
科学领域:
- 医疗图像分析 医学图像分析
- 医疗保健中的人工智能
- 机器学习模型评估评估
背景情况:
- 传统的重叠指标 (例如,Dice) 通常用于医疗图像细分,但可能与临床现实不一致.
- 公共数据集的病例分布和细分复杂性往往不同于现实世界的临床数据.
- 现有的指标可能对不确定,小或空的参考注释等挑战不敏感,影响模型开发.
研究的目的:
- 调查不确定的,小的,空的参考注释对医疗图像细分模型的性能指标的影响.
- 在具有挑战性的细分场景中准确反映临床价值的合适评估指标.
- 将不同数据集的度量行为进行比较,包括内部中风数据和公共数据集 (BRATS 2019,脊髓).
主要方法:
- 分析不同参考注释质量 (不确定的,小的,空的) 的冲动数据集上的度量性能.
- 检查一个标准的深度学习框架的预测,以了解在具有挑战性的设置中的度量行为.
- 与BRATS 2019和脊髓公开数据集的结果进行比较分析.
主要成果:
- 当参考注释不确定,小或空时,通常使用的性能指标可能会误导.
- 该研究强调了标准评估实践与临床应用的要求之间存在重大不匹配.
- 特定的指标需要重新评估,以确保在不同的临床环境中准确评估细分模型的性能.
结论:
- 重新考虑医疗图像细分模型的评估是必不可少的,特别是在处理不完美或有限的参考注释时.
- 当前的指标可能无法充分捕捉在现实场景中细分模型的临床实用性.
- 这些发现倡导开发和采用更强大的AI在医学成像中的评估策略.


