生物化学教育中的大型语言模型:绩效的比较评估
Olena Bolgova1, Inna Shypilova2, Volodymyr Mavrych1
1College of Medicine, Alfaisal University, Al Takhassousi St, Riyadh, 11533, Saudi Arabia.
JMIR medical education
|April 10, 2025
概括
医学中的大型语言模型 (LLM) 与学生相比,在医学生物化学问题上表现优越. 克劳德AI实现了最高的准确性,表明AIAI.
科学领域:
- 人工智能在医学中的应用
- 医疗教育 技术 技术 医学教育
- 大型语言模型 (LLM)
背景情况:
- 人工智能和法学士的进步正在彻底改变医学.
- 在通过医学委员会考试方面,LLM显示出潜力.
- 需要验证LLM能够回答特定学科的医疗问题的能力.
研究的目的:
- 为了比较先进的LLM聊天机器人的表现与医学生化学医学学生的表现.
- 分析Claude,GPT-4,Gemini和Copilot在生物化学多选题中的准确性.
主要方法:
- 利用了200个美国医学执照考试 (USMLE) 风格的多选择题 (MCQ),涵盖23个主题.
- 评价了克劳德3.5索内特,GPT-4-1106,双子座1.5闪光和副驾驶员的5次尝试,以获得准确性.
- 用于统计分析的千平方测试 (P<.05).
主要成果:
- 聊天机器人平均准确率为81.1%,比学生高出8.3% (P=.02).
- 克劳德实现了最高的准确性 (92.5%),其次是GPT-4 (85%),双子座 (78.5%) 和副驾驶员 (64%).
- 表现最好的主题包括eicosanoids,生物能量学,赫索索单酸盐通路和体.
结论:
- 人工智能模型在特定的医学领域表现出明显的优势,可能有助于生物化学教育.
- 士学位的表现表明AI在医学教育和评估中的巨大潜力.
- 人工智能工具可以为医学专业学科的学生提供有针对性的支持.


