人工智能-大语言模型 (AI-LLMs) 用于在产科实践中可靠和准确的心脏图谱 (CTG) 解释
Khanisyah Erza Gumilar1,2, Manggala Pasca Wardhana3, Muhammad Ilham Aldika Akbar2
1Graduate Institute of Biomedical Science, China Medical University, Taichung, Taiwan.
Computational and structural biotechnology journal
|April 10, 2025
概括
聊天GPT-4o在心电图解读方面表现优越,优于其他AI-LLM和初级医生. 这种先进的AI工具与高级医生的表现密切匹配,显示了改善产科护理的希望.
科学领域:
- 医疗成像医学成像
- 人工智能的人工智能
- 产科 产科 产科 产科 产科
背景情况:
- 准确的心电图解读 (CTG) 对于监测妊娠和分娩期间胎儿健康至关重要.
- 先进的人工智能 (AI) 工具,特别是AI大型语言模型 (AI-LLM),有可能提高CTG解释精度.
- 在CTG解释中AI-LLM的临床实用性和性能需要彻底评估.
研究的目的:
- 评估三种AI-LLM (ChatGPT-4o,Gemini Advanced,Copilot) 在解释CTG图像方面的性能.
- 将AI-LLM的解释与初级 (JHD) 和高级人类医生 (SHD) 的解释进行比较.
- 评估AI-LLM在产科护理临床决策中的可靠性.
主要方法:
- 七张CTG图像被三个AI-LLM,五个SHD和五个JHD解释.
- 专家评价由五位盲目的孕产妇医学专家进行,他们使用利克尔特等级来评估相关性,清晰度,深度,重点和连贯性.
- 进行了统计分析,以比较专家评级和小组表现的同质性.
主要成果:
- 聊天GPT-4o获得了77.86分的得分,超过了双子座高级 (57.14),副驾驶 (47.29) 和JHD (61.57).
- 聊天GPT-4o的性能 (77.86) 接近于SHD (80.43),没有统计学上显著的差异 (p > 0.05).
- 在深度参数方面,ChatGPT-4o特别出色,在其他评估参数方面仅略低于SHD.
结论:
- 在CTG解释中,ChatGPT-4o在评估的AI-LLM中表现优越.
- 聊天GPT-4o超越了初级医生的表现,并与高级医生紧密相匹配.
- 以ChatGPT-4o为例的AI-LLM显示出作为产科医生的辅助工具的巨大潜力,旨在提高诊断准确性和改善产科患者的护理.


