人类观察和深度学习模型之间的不一致:评估死后计算机断层扫描诊断溺水的有效性
Yuwen Zeng1, Xiaoyong Zhang2, Jiaoyang Wang3
1Department of Radiological Imaging and Informatics, Tohoku University Graduate School of Medicine, Sendai, Japan. yuwen@tohoku.ac.jp.
Journal of imaging informatics in medicine
|February 9, 2024
概括
用于溺水诊断的深度学习模型显示出高性能,但缺乏医学有效性. 突出地图显示不相关的特征,质疑这些人工智能工具在法医病理学中的可靠性.
科学领域:
- 法医病理学 法医病理学
- 医疗成像医学成像
- 人工智能的人工智能
背景情况:
- 在解剖中诊断溺水是具有挑战性的,即使使用先进的成像技术.
- 深度学习 (DL) 模型已经显示出用于溺水诊断的前景.
- 这些DL模型的医学有效性尚未先前评估.
研究的目的:
- 评估用于溺水诊断的DL模型的医学有效性.
- 确定DL模型的学习特征是否与专家放射学发现一致.
- 在法医解剖中评估高性能DL工具的可靠性.
主要方法:
- 以死后计算机断层扫描对尸检病例 (2012-2021) 的回顾性研究.
- 训练了三个DL模型并生成突出地图以突出显示重要的图像特征.
- 比较DL突出地图与放射技术专家的像素级注释.
主要成果:
- 这三种DL模型都实现了高分类性能 (AUC 0.94-0.98).
- 在模型突出性地图和专家注释之间发现了显著的不一致性.
- 模型在突出地图中显示了30-80%的无关区域,表明了潜在的不可靠性.
结论:
- 尽管分类准确度很高,但用于溺水诊断的DL模型可能不可靠.
- 仔细评估DL工具至关重要,即使性能指标很高.
- 这些发现强调了需要严格验证AI在法医学中的必要性.


