公共可用的大型语言模型对内部医学委员会式问题的表现
Constantine Tarabanis1, Sohail Zahid1, Marios Mamalis2
1Leon H. Charney Division of Cardiology, NYU Langone Health, New York University School of Medicine, New York, New York, United States of America.
PLOS digital health
|September 17, 2024
概括
大型语言模型 (LLM) 在医学考试中表现有希望,GPT-4.0在内部医学委员会问题上表现优于人类医生. 增加医学文本的LLMs提高了他们的准确性.
科学领域:
- 人工智能在医学中的应用
- 医疗教育 技术 技术 医学教育
- 大型语言模型 (LLM) 评估
背景情况:
- 目前正在进行的研究将大型语言模型 (LLM) 与使用医学检查的医生知识进行基准.
- 有限的研究评估了LLM在内部医学 (IM) 委员会考试问题上的表现.
- 特定领域的知识增强对医学环境中的LLM绩效的影响尚未得到充分证实.
研究的目的:
- 评估各种LLM (GPT-3.5,GPT-4.0,LaMDA,Llama 2) 在内部医学委员会式问题上的表现.
- 评估输入增强使用医学文本 (哈里森的内部医学原则) 对LLM绩效的影响.
- 为了将LLM的表现与IM委员会考试问题上的人类受访者进行比较.
主要方法:
- 使用了240个随机选择的IM板式问题,这些问题来自医学知识自我评估计划 (MKSAP).
- 通过API和聊天机器人接口访问LLM,并使用Harrison的内部医学原则进行检索增强生成 (RAG).
- 对正确答案的LLM生成的解释与盲目的,经过董事会认证的医生的人类生成的解释进行了比较.
主要成果:
- GPT-4.0获得了最高分数 (77.5-80.7%),超过了GPT-3.5,人类受访者,LaMDA和Llama 2.
- 在所有IM受试者中,GPT-4.0超过了人类MKSAP使用者,在传染病和风湿病学方面具有显著的优势.
- 通过RAG进行输入增强时,通过API访问时,GPT-3.5和GPT-4.0的性能增加了4.5-7.5%.
结论:
- 与其他LLM和人类受访者相比,GPT-4.0在内部医学委员会样式的问题上表现优异.
- 检索增强生成 (RAG) 是一种可行的技术,通过结合特定领域的知识来提高医学检查中的LLM准确性.
- 根据访问方法 (API与聊天机器人) 的不同,LLM的表现可能会有所不同,聊天机器人通常会显示更高的分数.
更多相关视频
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
516
09:00Author Spotlight: Validation of SICOLE-R for Assessing Cognitive and Reading Skills in Spanish-Speaking Children and Its Role in Personalized Education
Published on: August 16, 2024
718
