全球医学考试中的大型语言模型:平台开发和综合分析
Hui Zong1, Rongrong Wu1, Jiaxue Cha2
1Joint Laboratory of Artificial Intelligence for Critical Care Medicine, Department of Critical Care Medicine and Institutes for Systems Genetics, Frontiers Science Center for Disease-related Molecular Network, West China Hospital, Sichuan University, Chengdu, China.
Journal of medical Internet research
|December 27, 2024
概括
在全球医学考试中,MedExamLLM评估了大型语言模型 (LLM),揭示了GPT-4.
科学领域:
- 医疗教育中的人工智能
- 自然语言处理自然语言处理.
- 健康 专业 教育 卫生 专业 教育
背景情况:
- 大型语言模型 (LLM) 显示出医学教育和评估的前景.
- 在各种医学检查中,LLM的全球表现尚不清楚.
研究的目的:
- 介绍MedExamLLM,这是一个系统评估全球医学考试LLM绩效的平台.
- 编译和分析跨地区,语言和背景的LLM绩效数据.
- 为推进人工智能在医学教育中的整合提供资源.
主要方法:
- 系统的PubMed搜索 (2024年4月25日) 用英语进行,同行评审的研究评估医学考试的LLMs.
- 由两名研究人员进行独立选,对考试细节的数据整理,LLM绩效和参考资料.
- 将精选数据集成到MedExamLLM平台中进行可视化和分析.
主要成果:
- 分析了193篇文章,涵盖了28个国家和15种语言的16个LLM和198个医学考试 (2009-2023年).
- 发电预训练变压器 (GPT) 模型,特别是GPT-4,表现出卓越的性能.
- 在地理和语言背景下观察到LLM能力的显著变化.
结论:
- MedExamLLM是一个开源平台,用于评估全球医学考试的LLM绩效.
- 它是教育工作者,研究人员和开发人员将AI整合到医学中的资源.
- 局限性包括潜在的数据偏差和非英语文学的排除;未来的研究是必要的.
关键词:
在这里,我们可以看到AIAIAI.聊天GPT 聊天 在GPT 聊天在法律上,LLMs.人工智能是一种人工智能.发电预训练变压器 预训练变压器大型语言模型.医学教育 医学教育医学检查 医学检查 医学检查

