评估医生创建的头部和部超声波和大型语言模型中的多选择性测试
Jacob P S Nielsen1, August Krogh Mikkelsen1,2, Julian Kuenzel3
1Department of Otorhinolaryngology, Head and Neck Surgery and Audiology, Copenhagen University Hospital (Rigshospitalet), 2100 Copenhagen, Denmark.
Diagnostics (Basel, Switzerland)
|August 14, 2025
概括
大型语言模型 (LLM) 可以有效地起草头部超声波 (HNUS) 多选择题 (MCQ),但专家验证对于质量保证至关重要. 在创建初始问题草案时,LLM可以节省时间.
科学领域:
- 医学教育 医学教育
- 人工智能在医学中的应用
- 诊断成像 诊断成像 诊断成像
背景情况:
- 耳鼻喉科医生越来越多地使用头部和部超声波 (HNUS).
- 在HNUS从业者中评估理论知识是一个挑战.
- 本研究评估了用于生成HNUS评估工具的大型语言模型 (LLM).
研究的目的:
- 为了比较LLMs (ChatGPT,GPT4o,Google Gemini,Gemini Advanced) 的表现与医生生成的头部和部超声波多选题 (MCQ) 的表现.
- 根据专家评估标准,评估LLM产生的MCQ质量.
- 确定LLMs在为HNUS创建教育内容中的实用性.
主要方法:
- 医生和法学士对淋巴结,甲状腺和唾液腺产生了90个MCQ.
- HNUS专家使用类似Delphi的过程评估了医生起草的MCQ.
- 一个由盲目HNUS专家组成的国际小组评估了所有MCQ的清晰度,相关性,适用性,分心因素,理由和难度.
主要成果:
- 两种LLM之间没有发现显著的绩效差异.
- 在所有标准上,LLM生成的MCQ得分明显低于医学专家验证的MCQ.
- 与Google Gemini和ChatGPT相比,医生起草的问题在相关性和适合性等特定领域显示出显著的差异.
结论:
- 法律学士可以生成MCQ的初始草稿,与医生草稿相似,提供具有成本效益的时间管理.
- 然而,LLM生成的MCQ需要专家验证才能达到评估的质量标准.
- 法律法规的主要价值在于加速起草过程,而不是取代专家的人类投入.


