相关实验视频
Updated: Jan 21, 2026

A Porcine Model of Acute Autologous Pulmonary Embolism
Published on: September 6, 2024
患者护理中的人工智能:评估大型语言模型性能与肺栓塞的基于证据的指导方针
Ömer F Karakoyun1, Halil E Koyuncuoğlu1, Ömer H Sağnıç2
1Department of Emergency Medicine, Muğla Training and Research Hospital, Muğla, Türkiye.
四个人工智能 (AI) 大语言模型 (LLM) 被评估,以评估它们应用肺栓塞 (PE) 临床指南的能力. 聊天GPT-4o表现最好,但需要进一步开发,以便在医生工作流程中始终遵守指南.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 临床决策支持 临床决策支持
背景情况:
- 人工智能 (AI) 驱动的大型语言模型 (LLM) 越来越多地被整合到医疗保健中,用于患者教育.
- 在实际医生工作流程中解释和应用复杂的临床指南时,LLM的有效性在很大程度上尚未评估.
- 肺栓塞 (PE),其定义的管理协议,作为一个理想的模型来评估在临床指南应用中LLM的表现.
研究的目的:
- 评估四个领先的人工智能驱动的LLM (ChatGPT-4o,DeepSeek-V2,Gemini,Grok) 在应用2019年欧洲心脏病学会PE指南方面的表现.
- 评估这些LLM的临床准确性,准则遵守性和响应一致性,当与模拟PE病例一起呈现时.
主要方法:
- 基于模拟的PE病例,开发了10个开放式问题,涵盖诊断,风险分层,治疗和随访.
- 两名急诊医生使用10分级别对基于指南的参考答案进行了LLM答案的评分.
- 评估者之间的可靠性是使用类内相关系数 (ICC) 进行评估的,并使用克鲁斯卡尔-瓦利斯测试进行了组对比.
主要成果:
- 聊天GPT-4o获得了最高的整体得分 (76),其次是Gemini (73.75),Grok (71.25) 和DeepSeek-V2 (65),在总得分上没有统计学上显著的差异 (P = 0.390).
- 性能在各个类别中各不相同,ChatGPT-4o在后续和DeepSeek-V2在诊断方面表现出色.
- 专家评论员指出了强项,如ChatGPT-4o的结构化响应和Grok的实用性,同时确定了诸如个人化不足和指导方针差距等局限性. 评价者之间的协议非常出色 (ICC:0.986).
结论:
- 人工智能驱动的LLM在支持肺栓塞的管理方面显示出潜在的实用性.
- 在PE管理的所有评估领域中,没有一个LLM在PE管理的所有评估领域中始终表现出色.
- 进一步的进步是必要的,以改善临床整合和医疗保健环境中LLMs的一致的准则遵守.
更多相关视频
08:02Establishment of a Minimally Invasive Rat Model of Pulmonary Embolism Using Autologous Blood Clots
Published on: October 25, 2024
06:15Protocol and Guidelines for Point-of-Care Lung Ultrasound in Diagnosing Neonatal Pulmonary Diseases Based on International Expert Consensus
Published on: March 6, 2019
相关概念视频
Pulmonary Embolism II: Diagnostic Studies and Interprofessional Care
Pulmonary Embolism I: Introduction
Pulmonary Embolism III: Nursing Management
Patient-centered Care
The Evidence for Evolution
Language
Corballis and Suddendorf (2007) and Tomasello and Rakoczy (2003) highlight the role of language in...