评估人工智能对核心脏病的熟练程度:大型语言模型参加了委员会准备考试
Valerie Builoff1, Aakash Shanbhag1,2, Robert Jh Miller1,3
1Departments of Medicine (Division of Artificial Intelligence in Medicine), Imaging and Biomedical Sciences Cedars-Sinai Medical Center, Los Angeles, CA, USA.
medRxiv : the preprint server for health sciences
|July 29, 2024
概括
在核心脏病学考试中,GPT-4o表现优越,优于其他大型语言模型 (LLM). 虽然LLM显示出基于文本的问题的潜力,但医疗图像分析需要进一步改进.
科学领域:
- 人工智能在医学中的应用
- 医学成像分析 医学成像分析
- 核心脏病学应用 核心脏病学应用
背景情况:
- 以前的研究已经在医学领域探索了大型语言模型 (LLM),但很少有研究专门讨论了它们在心血管成像或核心脏病学方面的能力.
- 在医学图像分析中,LLM的应用,特别是在核心脏病学等专业领域,仍未得到充分研究.
研究的目的:
- 评估四个领先的大型语言模型 (LLM) 在回答与核心脏病相关的问题上的表现.
- 在模拟的董事会认证考试环境中比较GPT-4,GPT-4 Turbo,GPT-4o和Gemini的疗效.
主要方法:
- 这项研究利用了来自2023年美国核心脏病学会委员会准备考试的168个问题,包括141个纯文本问题和27个基于图像的问题.
- 每个LLM都接受了相同的标准化提示,并在四个考试部分中进行了30次测试,以确保可靠性,并在六周内评估绩效.
- 使用统计分析,包括McNemar的测试,以比较模型中正确回答问题的比例.
主要成果:
- GPT-4o实现了最高的中位数正确响应率63.1%,明显超过了GPT-4 Turbo (60.7%),GPT-4 (56.8%) 和Gemini (40.5%).
- GPT-4o在纯文本问题上表现特别强,超过了所有其他评估的LLMs.
- 双子座表现较差,特别是在基于图像的问题解释方面.
结论:
- GPT-4o成为表现最好的LLM,得分表明通过核心脏病学认证考试的潜力.
- 虽然目前的LLM显示出有望协助基于文本的临床查询,但医疗图像解释能力的进步对于更广泛的临床整合是必要的.


