商业深度学习模型的真实世界性能评估,用于内出血检测
Mohammadreza Chavoshi1, Aawez Mansuri1, Wasif Bala1
1Department of Radiology and Imaging Sciences, Emory University School of Medicine, Atlanta, GA, USA.
NPJ digital medicine
|December 24, 2025
概括
这项研究评估了一种AI模型,用于在头部CT扫描中检测内出血 (ICH). 人工智能在急性,大出血方面表现良好,但在微妙或慢性病例中扎,突出了进一步发展的需要.
科学领域:
- 放射学和医学成像学 医学成像学
- 医疗保健中的人工智能
- 神经学 神经学
背景情况:
- 内出血 (ICH) 是一种关键的医疗紧急情况,需要快速诊断.
- 美国食品和药物管理局批准的AI用于ICH检测的现实有效性仍在调查中.
- 深度学习模型为提高神经成像诊断速度和准确性提供了潜力.
研究的目的:
- 评估商业人工智能工具 (Aidoc Medical Briefcase ICH Triage) 的现实世界性能,用于检测内出血.
- 评估AI模型在各种ICH演示和患者环境中的灵敏度和特异性.
- 确定AI模型性能可能受到限制的特定场景.
主要方法:
- 追溯分析了来自17个机构的74,142名患者的101,944张无对比头部CT扫描.
- 使用GPT-4o,采用零射击即时精炼策略,从放射学报告中提取ICH标签和特征,根据500个手册注释进行验证.
- 评估了Aidoc AI模型的性能指标,包括灵敏度,特异性和准确性.
主要成果:
- 人工智能模型的整体准确率为96.6% (82.2%的灵敏度,97.6%的特异性).
- 对于急性 (86.2%),大 (>10毫米) 和多隔间出血 (93.6%) 观察到最高的敏感性.
- 对于亚急性 (45.5%),慢性 (54.8%),小 (≤10毫米) 和单间出血 (76.0%),以及门诊 (72.2%) 的性能降低,注意到敏感性较低.
结论:
- 人工智能模型在检测急性和广泛的内出血方面显示出可靠的性能.
- 对于微妙的,慢性或局部的ICH呈现,模型的灵敏度明显较低.
- 持续的现实世界评估和有针对性的AI改进对于ICH的安全临床分组至关重要.
