人工智能模型在胚胎选择中的稳定性和可靠性
Prudhvi Thirumalaraju1, Manoj Kumar Kanakasabapathy1, Hemanth Kandula1
1Division of Engineering in Medicine, Department of Medicine, Brigham and Women's Hospital, Harvard Medical School, Boston, MA, USA.
Fertility and sterility
|August 28, 2025
概括
在体外受精 (IVF) 胚胎选择的AI模型显示稳定性和一致性较差,导致错误率很高. 这些发现质疑目前用于排名胚胎的AI方法的临床可靠性.
科学领域:
- 人工智能在生殖医学中
- 胚胎学和辅助生殖技术
- 机器学习用于医学诊断
背景情况:
- 辅助生殖技术 (ART) 依赖于精确的胚胎选择以获得成功的体外受精 (IVF) 结果.
- 人工智能 (AI) 提供了客观胚胎评估的潜力,但其可靠性需要严格评估.
- 单一实例学习 (SIL) 模型预测胚胎形态的活产结果,但它们的稳定性尚未得到充分证实.
研究的目的:
- 评估用于胚胎选择和IVF排序的AI模型的稳定性和可靠性.
- 在不同数据集中评估人工智能驱动的胚胎评估的一致性和错误率.
- 研究复制人工智能模型之间的解释性和决策差异.
主要方法:
- 一项基于实验室的研究,使用50个复制的卷积神经网络 (CNN) 在两个独立的试管婴儿数据集 (MGH和Cornell) 上进行训练.
- 通过胚胎排序一致性 (肯德尔的W),关键错误率和模型间的可变性来评估模型性能.
- 使用梯度加权类激活映射 (GradCAM) 和t分布式随机邻居嵌入 (t-SNE) 的可解释性分析来探索模型决策.
主要成果:
- 人工智能模型表现出胚胎排名一致性差 (肯德尔的W ≈0.35) 和高临界错误率 (≈15%).
- 在外部数据集上测试模型时,观察到显著的模型间变异性,不稳定性增加 (误差差分值: 46. 07%2).
- 尽管训练方案相同,但可解释性分析显示复制模型的决策策略不同.
结论:
- 试管婴儿胚胎选择的单一实例学习 (SIL) AI模型显示出大量的不稳定性和不一致性,影响了临床可靠性.
- 高的模型间变异性和关键错误率引发了对现有人工智能模型对胚胎选择的实际部署的担忧.
- 这项研究强调需要更稳定的人工智能框架和专门针对试管婴儿临床需求的强大评估指标.


