评估高级大型语言模型在医学知识中的有效性:使用日本国家医学检查进行的比较研究
Mingxin Liu1, Tsuyoshi Okuhara2, Zhehao Dai3
1Department of Health Communication, Graduate School of Medicine, The University of Tokyo, Tokyo, Japan.
International journal of medical informatics
|October 29, 2024
概括
GPT-4o在医学知识中表现出高精度,在日本医学考试中表现优于其他先进的AI模型. 它的表现在更容易的问题和非基于图像的查询上最强,突出了AI在医学教育中的潜力.
科学领域:
- 人工智能在医学中的应用
- 医疗教育 技术 技术 医学教育
- 大型语言模型 (LLM)
背景情况:
- 大型语言模型 (LLM) 的快速发展需要对其医学知识准确性的评估.
- 在标准化医学检查上评估LLM的表现对于了解它们在医疗保健和教育中的实用性至关重要.
- 这项研究是第一个使用非英语医学执照考试来评估领先的LLM的研究.
研究的目的:
- 评估高级LLM的医学知识准确性,包括GPT-4o,GPT-4,Gemini 1.5 Pro和Claude 3 Opus.
- 通过不同类型的问题 (图像与非图像,难度级别,一般与临床) 和医学专业来比较LLM的表现.
- 确定LLM作为医学教育和临床诊断工具的潜力.
主要方法:
- 日本国家医学考试的790个问题被输入到四个高级LLM中.
- 两位作者独立评估了答案的正确性.
- 基于总体准确性,问题特征和医学专业,包括与出版物数量的相关性,分析了LLM绩效.
主要成果:
- GPT-4o实现了最高的整体准确度 (89.2%),明显超过其他LLMs.
- 所有的LLM在非图像 (10%的差距) 和简单问题上表现更好,而不是基于图像和困难的问题.
- "胃肠病学和肝病学"的表现最低,LLM表现和专业出版物数量之间存在正相关性.
结论:
- GPT-4o显示出作为医学知识来源的巨大潜力,特别是对于更简单的问题,达到近90%的准确性.
- 法学士准确度受到问题格式 (图像与非图像) 和难度的重大影响.
- 该研究强调需要进一步研究跨不同医学领域和语言的LLM能力,其性能与出版量相关.


