在性结肠炎中进行内镜评分的混合机器学习-人类判断范式的比较评估
Klaus T Gottlieb1, Chakib Battioui2, Yeli Wang3
1Eli Lilly and Company, Indianapolis, Indiana, USA klaus.gottlieb@gmail.com.
BMJ open gastroenterology
|December 8, 2025
概括
一种用于性结肠炎试验的新中央阅读方法,使用两个机器学习模型加上人体审查 (2M+1H),证明与传统方法一样准确. 这种方法提高了内镜评分的操作效率和可重复性.
科学领域:
- 胃肠病学 胃肠病学
- 医疗成像医学成像
- 人工智能的人工智能
背景情况:
- 对性结肠炎 (UC) 疾病活动的内镜评分对于临床试验至关重要.
- 目前的方法存在读器间的变化和操作复杂性的问题.
- 开发了一个新的中央阅读范式,2M+1H,集成机器学习和人类判断.
研究的目的:
- 评估"2M+1H"中央阅读模式是否在统计学上与UC内镜评分的传统两位阅读者加判定者模型相比不劣.
- 评估新范式的准确性,效率和可重复性.
主要方法:
- 使用传统和"2M+1H"中央阅读方法,对150个UC内镜视频进行了回顾性评分.
- 开发两个独立的机器学习模型,具有不同的算法和数据集.
- 在"2M+1H"范式中,经过董事会认证的胃肠科医生对不一致的机器学习模型得分进行人类判断.
- 主要终点:通过二次加权卡帕与参考标准的一致性;次要终点:对二进制结果的一致性,减少人类读数和结果的可变性.
主要成果:
- "2M+1H"方法实现了0.78的二次加权卡帕,达到非劣势值.
- 与参考标准的一致性为内镜改善的82.7%,缓解的89.3%.
- 与传统方法相比,2M+1H模式减少了81%的人类阅读量.
- 传统的只对人类的方法显示得分的变化,有16%的案例根据读者分配产生不同的最终分数.
结论:
- "2M+1H"中央阅读范式显示了性结肠炎内镜评分的统计学准确性.
- 这种新的方法提供了更好的运营效率和潜在的增强可重复性.
- 建议对临床,生物标志物和组织学结果进行"2M+1H"范式的前性验证.


