专门的大型语言模型的可行性研究生医学考试准备:单中心的概念验证研究研究
Yun Hao Leong1,2, Lathiga Nambiar1, Victoria Y J Tay1,2
1Division of Anesthesiology and Perioperative Medicine, Singapore General Hospital, Singapore, Singapore.
JMIR formative research
|December 3, 2025
概括
一个专门的大型语言模型 (LLM),个性化麻醉研究支持 (PASS),显示出对研究生麻醉学考试准备的承诺. 通过证明了良好的用户接受和分级可靠性,用户有效地识别幻觉.
科学领域:
- 医疗教育 技术 技术 医学教育
- 人工智能在医学中的应用
- 麻醉学 检查 麻醉学 检查
背景情况:
- 大型语言模型 (LLM) 越来越多地用于医学教育,但在研究生考试准备方面面临挑战,包括分级一致性和用户接受.
- 由于对可靠性和准确性的担忧,LLM在高风险的医学检查中的作用需要进一步调查.
研究的目的:
- 评估个性化麻醉研究支持 (PASS),一种专门的GPT-4模型用于麻醉学考试准备.
- 在高风险的考试环境中评估PASS的用户接受度,分级可靠性和幻觉检测率.
主要方法:
- 通过,GPT-4模型,被调整为领域特定的数据,用于麻醉学考试准备.
- 21名居民完成了模拟考试,由人类考官和PASS评分;参与者还完成了一项技术接受调查.
- 评分可靠性是使用科恩和弗莱斯卡帕统计数据来评估的; 幻觉率是由参与者和考试人员评估的.
主要成果:
- 与标准GPT-4相比,PASS在实用性,效率和未来使用方面获得了显著更高的用户认可.
- 内部分级可靠性在PASS中适度 (κ=0.522) 和在人类检查员中相当 (κ=0.275).
- 候选人和考官之间的幻觉检测率是可比的,尽管考官发现了更多的偏差.
结论:
- 通过证明了高风险考试准备的可行性,由于强大的用户接受和评分可靠性.
- 经验丰富的学习者可以检测到主要的幻觉,这表明LLM具有自我指导学习的潜力,但仍然建议谨慎.
- 需要进一步的研究来提高分级准确性,并评估在多中心研究生医学教育环境中专门的LLM.
更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
1.3K
05:56Objectification of Tongue Diagnosis in Traditional Medicine, Data Analysis, and Study Application
Published on: April 14, 2023
3.2K
