在中文标准化听力学家资格考试中,ChatGPT和DeepSeek的比较:观察性研究
Beier Qi1, Yan Zheng1, Yuanyuan Wang1
1Beijing Tongren Hospital, Capital Medical University, Key Laboratory of Otolaryngology - Head and Neck Surgery (Capital Medical University), Ministry of Education, Beijing, China, Beijing, China.
JMIR formative research
|November 28, 2025
概括
像ChatGPT和DeepSeek这样的生成人工智能 (GenAI) 模型在听力学考试中表现强,超过了通过分数. 虽然它们对教育很有希望,但它们的使用需要由于错误而受到监督,特别是复杂的问题类型.
科学领域:
- 听力学 听力学是指听力学.
- 人工智能的人工智能
- 医学教育 医学教育
背景情况:
- 生成型人工智能 (GenAI) 正在迅速发展,影响医学和教育等领域.
- 像ChatGPT和DeepSeek这样的模型展示了越来越多的推理能力和广泛的应用性.
研究的目的:
- 在中国听力学家资格考试中评估GPT-4-turbo和DeepSeek-R1的性能.
- 探索这些GenAI模型在听力学教育和临床培训中的潜力.
主要方法:
- 通过了2024年台湾听力学家资格考试 (6个科目300个选择题).
- 通过总体准确性,学科特定得分和问题类型分析来评估GenAI模型的性能.
- 记录了回答过程和推理路径,并使用McNemar测试进行了统计比较.
主要成果:
- 聊天GPT (80.3%) 和DeepSeek (79.3%) 都超过了60%的合格标准.
- 模型在基本听力科学和听力/言语障碍方面显示出高准确度,但在行为听力学方面得分较低.
- 性能因问题类型而异,在反向逻辑方面表现强,但在复杂的多选项和基于图表的问题方面表现弱.
结论:
- 基因AI模型表现出显著的专业知识和推理能力,满足临床听力学家的基本要求.
- 这些模型显示出在听力学教育中作为辅助工具的潜力,但由于发现错误,需要监督使用.
- 需要进一步的研究来评估在现实世界临床场景中的实际适用性.


