相关实验视频
Updated: May 16, 2025

12:10
Semi-automated Optical Heartbeat Analysis of Small Hearts
Published on: September 16, 2009
12.1K
用GPT-4大型语言模型自动计算HEART分数
Donald S Wright1, Vimig Socrates2, Thomas Huang1
1Department of Emergency Medicine, Yale School of Medicine, New Haven, CT, United States; Department for Biomedical Informatics and Data Science, Yale School of Medicine, New Haven, CT, United States.
The American journal of emergency medicine
|April 4, 2025
概括
GPT-4大型语言模型 (LLM) 在计算HEART分数和预测主要不良心脏事件 (MACE) 中表现出与临床医生相比的准确性. 然而,LLM与医生的判断有系统的差异,需要进一步的研究.
科学领域:
- 人工智能在医学中的应用
- 临床决策支持系统 临床决策支持系统
- 心脏病学风险分层分层
背景情况:
- 自动化HEART分数计算为临床决策支持和安全干预提供了潜力.
- 在临床风险评分中评估大型语言模型 (LLM) 的性能至关重要.
研究的目的:
- 为了评估GPT-4 LLM在计算HEART分数的准确性.
- 评估LLM预测60天重大心脏不良事件 (MACE) 的能力.
主要方法:
- 胸痛观察单元患者的回顾性队列研究 (2022年2月 - 2023年9月).
- 由临床医生 (APP) 和GPT-4 LLM使用非识别图表数据计算的HEART分数.
- 通过科恩的卡帕评估的一致性;MACE预测根据裁决的得分和临床结果进行评估.
主要成果:
- 与裁决机构的LLM协议 (kappa=0.67) 与APP协议 (kappa=0.66) 类似.
- 在LLM计算的平均HEART分数 (5.06) 比评审 (4.69) 或APP (4.23) 高.
- 在LLM和评委之间预测60天的MACE没有显著差异 (p > .05).
结论:
- LLM显示了自动化风险评分计算和临床决策支持的潜力.
- 在LLM得分和医生判断之间存在系统的差异.
- 需要前性研究来验证临床环境中的LLM绩效.

