在核心脏病学中评估AI熟练程度:大型语言模型参加董事会准备考试
Valerie Builoff1, Aakash Shanbhag2, Robert Jh Miller3
1Departments of Medicine (Division of Artificial Intelligence in Medicine), Imaging and Biomedical Sciences, Cedars-Sinai Medical Center, Los Angeles, CA, USA.
概括
在四个大型语言模型中,GPT-4o在回答核心脏病学考试问题方面表现最好. 虽然图像分析需要改进,但GPT-4o对协助医生进行临床基于文本的查询充满了希望.
科学领域:
- 人工智能在医学中的应用
- 医学成像分析 医学成像分析
- 核心脏病学 核心脏病学
背景情况:
- 关于心血管成像和核心脏病学的大语言模型 (LLM) 的研究有限.
- 本研究评估了四个LLM在核心脏病学委员会准备问题上的表现.
研究的目的:
- 评估GPT-4,GPT-4 Turbo,GPT-4o和Gemini在回答核心脏病学认证委员会 (CBNC) 考试相关问题的能力.
- 为了比较这些LLM的性能,特别是基于文本和基于图像的心血管成像问题.
主要方法:
- 来自2023年美国核心脏病学会委员会准备考试的168个问题被使用,其中包括141个纯文本问题和27个基于图像的问题.
- 每个LLM在每个问题类别中都进行了30次测试,以考虑变化.
- 使用McNemar的测试来比较正确的响应比例来评估性能.
主要成果:
- GPT-4o实现了最高的中位数正确响应率63.1%,明显超过了GPT-4 Turbo (60.7%),GPT-4 (56.8%) 和Gemini (40.5%).
- 与所有其他模型相比,GPT-4o仅在文本问题上表现优越.
- 双子座在基于图像的问题上表现明显差.
结论:
- GPT-4o表现最强,得分可能接近CBNC类考试的通过门.
- 虽然目前的LLM需要进一步开发医学图像解释,但GPT-4o显示了支持医生在核心脏病学中基于文本的临床问题的潜力.


