人工智能生成的生物化学测试项参数在MST测试条件中的参数
Murat Polat1,2, Engin Karadag3,4
1Anadolu University, Eskisehir, Turkey.
BMC medical education
|December 22, 2025
概括
聊天GPT 4o在估计医疗评估项目难度方面显示中等准确性,但系统地高估了. 对AI在医学教育评估中的进一步校准和监督是必要的.
科学领域:
- 医学教育评估 医学教育评估
- 教育中的人工智能
- 心理测量 心理测量 心理测量
背景情况:
- 调查像ChatGPT 4o这样的AI工具的准确性,以估计医疗评估项目的难度.
- 将AI预测与来自多阶段测试模拟的经验性衍生参数进行比较.
研究的目的:
- 评估ChatGPT 4o在估计医疗评估项目难度方面的能力.
- 将人工智能生成的难度估计与模拟衍生的参数进行比较.
主要方法:
- 使用混合模拟验证设计.
- 创建80个多选题生物化学问题与AI估计的难度参数 (b参数).
- 通过模拟多阶段测试对5000名虚拟考生进行问题管理.
主要成果:
- 在AI生成和模拟衍生的难度参数之间发现了中等一致性 (r=0.612).
- 聊天GPT 4o系统地高估了项目难度 (平均偏差=0.240).
- 对于非常容易的项目,人工智能估计的准确性较低,与中等难度项目相比,错误率更高.
结论:
- 聊天GPT 4o对医学教育中的初步项目生成有希望,但需要经验校准和专家监督.
- 基于模拟的验证有局限性;实际的学生绩效数据对于严格的心理测量验证至关重要.
- 将人工智能集成到医学教育评估中需要仔细验证,以解决系统偏见并确保准确性.


