在母胎医学中人工智能决策表现:在一个跨部门案例研究中,聊天GPT-4,双子座和人类专家的比较
Matan Friedman1,2, Amit Slouk1,2, Noa Gonen1,2
1Department of Obstetrics and Gynecology, E. Wolfson Medical Center, Holon 5822012, Israel.
Journal of clinical medicine
|January 10, 2026
概括
大型语言模型在常规的母胎医疗病例中表现有前途,但与复杂性作斗争. 人工智能建议需要谨慎的整合,因为在复杂的场景中,风险的潜在优先级可能不足.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 孕产妇和胎儿医学 孕产妇和胎儿医学
背景情况:
- 像ChatGPT-4和Gemini这样的大型语言模型 (LLM) 在高风险的母胎医学 (MFM) 中的可靠性是不确定的.
- 在MFM中AI错误可以显著影响孕妇和胎儿.
- 评估AI与MFM专家建议的结合对于临床整合至关重要.
研究的目的:
- 评估AI产生的病例管理建议对MFM专家的准确性和临床相关性.
- 在MFM场景中测量人工智能和人类专家建议之间的一致性.
- 根据案例的复杂性,识别LLM的性能变化.
主要方法:
- 一项涉及20个假设MFM病例的横截面研究.
- 来自ChatGPT-4,Gemini和三名MFM专家的回复被22名失明的MFM专家评估.
- 使用斯皮尔曼的rho和科恩的kappa测量了一致性;用威尔科克森的签名等级测试分析了精度差异.
主要成果:
- 聊天GPT-4显示中度对齐 (ρ = 0.408, κ = 0.232) 和与常规病例中的临床医生可比的准确性.
- 双子座的平均得分较高,但缺乏一致的评级者间一致性 (κ = -0.024) ,准确性明显较低.
- 在简单的,基于指导方针的场景中,人工智能的表现更好,而复杂的案例则变化更大.
结论:
- 人工智能工具显示出在常规MFM场景中支持决策的潜力.
- 目前,在复杂的MFM案件中,LLMs面临着局限性,有时无法充分平衡母胎风险.
- 人工智能在临床实践中的谨慎整合是有必要的,承认目前的限制和需要进一步验证.


