一个大型的语言模型可以创建可接受的牙科董事会样式的考试问题吗? 一个横截面的前性研究
1Department of Oral and Maxillofacial Radiology, Kyung Hee University Dental Hospital, Seoul, Republic of Korea.
Journal of dental sciences
|April 14, 2025
概括
大型语言模型 (LLM) 可以生成牙科委员会样式的考试问题,其质量与人类专家创建的问题相美. 项目分析显示,在LLM产生的问题和人类创建的问题之间,难度,歧视或分心效率没有显著差异.
科学领域:
- 牙科教育 牙科教育
- 教育中的人工智能
- 评估和评价的评估和评估.
背景情况:
- 大型语言模型 (LLM) 证明了在标准化测试中的熟练程度.
- 在创建高风险的专业考试中应用LLMs需要严格的评估.
- 对LLM产生的问题的质量与专家创建的问题进行评估对于教育评估至关重要.
研究的目的:
- 为了比较由大型语言模型 (LLM) 生成的国家牙科委员会样式考试问题的质量,与由人类专家开发的问题进行比较.
- 评估LLM生成问题的表现,使用项目分析指标,如难度,歧视和分心效率等.
主要方法:
- 一个大型语言模型 (ChatGPT 4o) 产生了44个牙科板式问题.
- 20个LLM生成的问题被随机选择,并与20个类似内容的专家创建的问题进行比较.
- 三十名牙科高级学生自愿回答了这两组问题,对答案进行了分析,以项目难度,歧视指数和分心器效率为准.
主要成果:
- 医学士组的中位难度指数为55.00%,人类组为50.00%,两者均被认为是优秀的.
- 在LLM组中,歧视指数的中位数为0.29,在人群中为0.14.
- 无论是LLM和人类集,均达到80.00%的中位分心效率,在集之间没有观察到统计学上显著的差异 (P > 0.050).
结论:
- 大型语言模型可以产生与人类专家创建的质量相当的全国委员会式考试问题.
- 这些发现表明,LLM是开发牙科教育中高质量的评估项目的一个可行的工具.
- 进一步的研究可以探索LLM在创建多种评估格式的可扩展性和特定应用.


