基于AI的放射治疗细分和规划研究的评分偏差的评估,使用修改的TRIPOD和PROBAST指南作为例子
Coen Hurkmans1, Jean-Emmanuel Bibault2, Enrico Clementel3
1Dept. of Radiation Oncology, Catharina Hospital Eindhoven, the Netherlands; Dept. of Electrical Engineering, Technical University Eindhoven, the Netherlands.
概括
在放射治疗研究中使用适应的检查清单评估人工智能 (AI) 显示出可靠性较低. 这凸显了客观评分人工智能应用程序的挑战,并强调了无偏见的指南的必要性.
科学领域:
- 放射治疗研究的研究.
- 人工智能应用程序的人工智能应用
- 医学成像和治疗规划.
背景情况:
- 在放射治疗中对人工智能 (AI) 的研究质量差异很大.
- 人工智能研究得分的透明度和偏见是关键问题.
- 在细分和治疗规划中的AI需要强大的评估方法.
研究的目的:
- 评估基于AI的放射治疗文章的评分透明度和偏见.
- 适应和评估用于AI应用的PROBAST和TRIPOD检查清单.
- 为未来的指南制定和审查流程提供建议.
主要方法:
- 通过Delphi过程修改了PROBAST和TRIPOD检查清单.
- 通过使用适应的检查清单,获得了10篇以人工智能为重点的放射治疗文章.
- 计算Fleiss' kappa以衡量观察者之间的一致性和可靠性.
主要成果:
- 在适应的检查清单中观察到低可靠性得分 (kappa值往往不具有统计学意义).
- 在61个检查清单项目中,只有2个项目被发现有显著的一致性 (kappa >= 0.4).
- 许多检查清单项目显示一致性不如偶然性,表明可靠性不佳.
结论:
- 经过调整的PROBAST和TRIPOD检查清单表明,在放射治疗研究中评分AI的可靠性很低.
- 当前的检查清单可能不适合客观地评估AI应用程序,而不会引入偏见.
- 未来的指导方针必须考虑检查清单的适用性和AI研究评估中的潜在偏见.


