大型语言模型在泰国国家医疗执照考试中的表现:一个横截面研究
Prut Saowaprut1, Romen Samuel Wabina1, Junwei Yang1
1Department of Clinical Epidemiology and Biostatistics, Ramathibodi Hospital, Faculty of Medicine, Mahidol University, Bangkok, Thailand.
概括
一般用途的大型语言模型 (LLM) 显示出泰国医疗执照考试准备的前景. 虽然超过通过分数,但对于特定的医疗领域和多模式集成需要进一步改进.
科学领域:
- 医疗教育中的人工智能
- 医学执照考试 医学执照考试
- 健康 公平 卫生 公平
背景情况:
- 泰国国家医疗执照考试 (ThaiNLE) 缺乏标准化的学习材料,可能会在准备过程中造成不平等.
- 一般用途的大型语言模型 (LLM) 为可访问和标准化的医学教育资源提供了潜在的解决方案.
研究的目的:
- 评估使用通用LLM用于泰国NLE第一步准备的可行性.
- 评估LLM在解决医疗执照考试准备中的潜在不平等现象方面的表现.
主要方法:
- 四个多模式的LLM (GPT-4,Claude 3 Opus,Gemini 1.0/1.5 Pro) 在304个问题的泰国NLE第一步模拟考试中进行了测试.
- 使用微观和宏观准确度指标与历史传递值进行性能测量,每个模型进行5次推断重复.
主要成果:
- 所有评估的LLM都超过了泰国NLE的通过分数,GPT-4获得了最高的准确性 (88.9%).
- 模型在大多数医学领域都表现出强的表现,但在遗传学和心血管主题方面存在差异.
- 虽然多式联机功能表现有前途,但大多数模型的仅文本性能仍然优越.
结论:
- 一般目的的LLM证明了作为泰国NLE第一步准备的公平工具的潜力.
- 需要进一步开发,以解决特定领域的知识差距,并在广泛临床使用之前改善多模式集成.


