利用大型语言模型生成眼科教育多选题
Shahrzad Gholami1, Daniel B Mummert2, Beth Wilson2
1AI for Good Research Lab, Microsoft, Redmond, Washington.
JAMA ophthalmology
|October 16, 2025
概括
像GPT-4这样的大型语言模型 (LLM) 可以生成高质量的眼科多项选择题 (MCQ),与专家撰写的问题相似. 这项技术有望扩大眼科医生培训和检查资源.
科学领域:
- 眼科 教育 技术 眼科 教育 技术
- 医疗评估中的人工智能
- 医学检查发展 医学检查发展
背景情况:
- 高质量的多选题 (MCQ) 对于眼科住院培训和董事会认证至关重要.
- 对于专家委员会来说,制定这些MCQ是耗时和资源密集的.
研究的目的:
- 评估通用域大语言模型 (LLM),特别是GPT-4在生成高质量,新和可读的眼科MCQ方面的能力.
- 将LLM生成的MCQ与由经验丰富的眼科考试作者的委员会创建的MCQ进行比较.
主要方法:
- 一项调查研究将GPT-4o产生的MCQ与人类专家委员会的MCQ进行了比较.
- 十名口罩专家眼科医生根据10点利克特级别对MCQ的适当性,清晰性,相关性,辨别力和适合学员的适用性进行了评估.
- 使用字符串相似性,可读性的Flesch阅读方便性和评审者间可靠性 (ICC) 来评估LLM的性能.
主要成果:
- 在GPT-4o生成的MCQ中,大多数标准 (例如,适当性,清晰性,相关性) 的中位数得分与专家撰写的问题相当.
- 在LLM生成的MCQ中,与现有内容的相似度得分很低 (<60),表明新性.
- 在LLM生成和人类专家MCQ之间,可读性得分相似,评审者之间的可靠性中等.
结论:
- 大型语言模型显示了开发眼科委员会式MCQ的潜力,有助于扩大考试银行.
- 由LLM生成的MCQ的质量,新性和可读性是有希望的,但需要进一步评估.
- 通过提供一个可扩展的方法来生成MCQ,LLM可以支持眼科住院培训.
更多相关视频
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
