在心电图解释中比较DeepSeek和GPT-4o:人工智能是否随着时间的推移而得到改善?
Serkan Günay1, Ahmet Öztürk1, Anılcan Tahsin Karahan1
1Hitit University Çorum Erol Olçok Education and Research Hospital, Department of Emergency Medicine, Çorum, Turkey.
Heart & lung : the journal of critical care
|September 14, 2025
概括
与GPT-4o和人类专家相比,DeepSeek在心电图 (ECG) 解释方面的准确性较低. 在临床使用这些大型语言模型 (LLM) 之前,需要进一步验证.
科学领域:
- 人工智能在医学中的应用
- 医学诊断 医学诊断 医学诊断
- 大型语言模型
背景情况:
- DeepSeek是一种新的大型语言模型 (LLM),具有尚未开发的心电图 (ECG) 解释能力.
- 已经研究了GPT-4o的ECG解释,但DeepSeek的性能是未知的.
研究的目的:
- 评估DeepSeek的心电图解释准确性.
- 将DeepSeek的表现与GPT-4o,心脏病学家和急诊医学专家进行比较.
- 评估GPT-4o在一年中的性能变化.
主要方法:
- 通过GPT-4o和DeepSeek评估了40张心电图像 (20个常规图像,20个挑战图像).
- 每个模型都被测试了13次.
- 模型的性能与人类专家的答案和GPT-4o上一年的结果进行了比较.
主要成果:
- 在常规,挑战性和总ECG (p<0.001) 的准确性方面,GPT-4o的表现优于DeepSeek.
- 观察到对GPT-4o的适度一致 (弗莱斯卡帕=0.473) 和对DeepSeek的实质一致 (弗莱斯卡帕=0.712).
- GPT-4o没有显示出与去年相比显著的业绩改善.
结论:
- DeepSeek的ECG解释性能低于GPT-4o和人类专家.
- 这两种AI模型都不足以达到专家级准确性.
- 在临床整合LLMs用于ECG解释之前,需要谨慎和进一步验证.


