在试管婴儿实验室的个人KPI:它们是可测量的还是可扭曲的? 使用基于AI的基准测试的案例研究
Péter Mauchart1,2, Emese Wágner2, Krisztina Gödöny1,2
1National Laboratory on Human Reproduction, University of Pécs, H-7624 Pécs, Hungary.
Journal of clinical medicine
|October 16, 2025
概括
人工智能 (AI) 可以在试管婴儿实验室比较胚胎学家的表现,但个人关键表现指标 (KPI) 可能会因患者年龄而扭曲. 人工智能基准测试通过调整案例组合来提供更公平的评估,尽管对高风险群体的偏见需要进一步研究.
科学领域:
- 生殖医学 生殖医学
- 在体外受精 (IVF)
- 医疗保健中的人工智能
背景情况:
- 关键绩效指标 (KPI) 对于评估试管婴儿实验室胚胎学家的表现至关重要.
- 然而,标准的KPI通常受到患者人口统计学,治疗指示和病例分配的影响,可能会扭曲绩效评估.
- 人工智能 (AI) 提出了一种新的方法,用于将个人关键关键指标与上下文意识的预测进行比较,旨在实现更客观的评估.
研究的目的:
- 评估基于个人临床怀孕率 (CPR) 的KPI与AI衍生的预测相比是否可测量或扭曲.
- 评估患者年龄,BMI和医生对AI基准KPI准确性的影响.
主要方法:
- 一个胚胎学家对474个仅进行细胞内质精子注射 (ICSI) 的周期进行了回顾性分析.
- 开发一个随机森林模型,在1294个机构周期中进行训练,以生成AI预测的CPR.
- 在不同患者年龄组,BMI类别和医生使用对对比和校准统计数据进行观察和AI预测的CPR的比较.
主要成果:
- 总体而言,观察和AI预测结果之间的CPR相似 (0.31与0.33).
- 在40岁以上的年龄组 (观察0.11对预测0.18) 和35-40岁的年龄组 (观察0.39对预测0.33) 观察到显著差异.
- 对于BMI类别,没有发现显著的校准错误,但医生级别的比较表明了变化.
结论:
- 个人胚胎学家的KPI是可测量的,但受患者和医生因素的影响.
- 人工智能基准测试可以通过调整案例组合来提高公平性,但系统偏见可能会在高风险患者子组中持续存在.
- 需要进一步的多操作员,多中心验证,以确认人工智能驱动的性能基准测试的普遍性.


