试验:AI模型临床收益和有效性的可靠报告和评估
Farzaneh Fazilati1, Mohammad Zakaria Rajabi2, Nima Alihosseini1
1Department of Biomedical Engineering, Faculty of Engineering, University of Isfahan, Isfahan 8174673441, Iran.
Diagnostics (Basel, Switzerland)
|March 14, 2026
概括
本综述介绍了TRIAGE,这是评估诊断AI的框架. 它确保人工智能模型经过严格测试以确保安全的临床采用,超越单一指标,实现全面的临床实用性.
科学领域:
- 人工智能在医学中的应用
- 临床决策支持系统 临床决策支持系统
- 机器学习用于医疗保健
背景情况:
- 机器学习 (ML) 在医学成像,生物信号解释和基于EHR的决策支持方面显示出临床诊断的前景.
- 目前的诊断AI研究往往缺乏严格的评估,依赖于有限的回顾性数据和单一的性能指标,阻碍了临床采用.
- 报告的AI模型性能与安全有效的临床整合所需的证据之间存在差距.
研究的目的:
- 提出TRIAGE,这是一个临床基础的框架,用于评估诊断AI.
- 将人工智能测试结构化为与临床用例 (选,分拣,第二次阅读,确认测试) 相一致的证据管道.
- 为可重现和临床解释的诊断AI性能报告提供全面指南.
主要方法:
- 总结了核心歧视指标 (灵敏度,特异性,预测值,概率比,诊断几率比,F分) 和它们的解释.
- 对多类/多标签任务,校准,临床实用性 (ROC,精度回忆,决策曲线分析),稳定性,公平性和验证设计的评估策略进行了审查.
- 综合表示曲线,校准评估和临床实用性分析,解决值依赖的部署.
主要成果:
- 强调流行率和频谱效应对于解释预测值和临床工作量的重要性.
- 对复杂的诊断任务进行详细的评估方法和统计学上合理的模型比较.
- 解决了防泄漏验证,计算限制 (延迟,吞吐量,能量) 和稳定性/公平性.
结论:
- TRIAGE框架为诊断AI评估提供了一个结构化的方法,使测试与临床现实保持一致.
- 使用TRIAGE进行全面评估对于弥合AI开发和安全临床采用之间的差距至关重要.
- 一个结构化的检查清单支持可重现和临床上有意义的诊断AI性能报告.
