评估人工智能性能在耳鼻喉科住院在职考试
Arushi P Mahajan1, Christina L Shabet1, Joshua Smith2
1University of Michigan Medical School Ann Arbor Michigan USA.
OTO open
|November 30, 2023
概括
大型语言模型对耳鼻喉医学教育的可靠性有限. 聊天GPT只回答了53%的实践问题正确地,突出了目前AI对外科学员的限制.
科学领域:
- 医学教育 医学教育
- 人工智能在医学中的应用
- 耳鼻喉科 耳鼻喉科 耳鼻喉科
背景情况:
- 亚专业医疗领域需要准确和全面的学习资源.
- 外科实习生和学习者需要可靠的工具来准备考试.
- 人工智能 (AI) 在医学教育中的有效性正在调查中.
研究的目的:
- 评估大型语言模型 (LLM) 的可靠性和潜在用途,以回答耳鼻喉科-头手术实践问题.
- 评估人工智能目前在为外科学习者提供准确答案和解释方面的有效性.
主要方法:
- 使用了一个公共的,付费访问的耳鼻喉科问题库.
- 问题是手动输入到ChatGPT.
- 将ChatGPT的输出与问题库的基准答案和解释进行了比较,以确保准确性和全面性.
主要成果:
- 聊天GPT实现了53%的正确答案率和54%的正确解释率.
- 答案和解释的准确性随着问题的难度增加而下降.
- 该LLM在提供可靠的医学教育内容方面表现出显著的局限性.
结论:
- 目前的人工智能驱动的学习平台还不够强大,无法在子专业领域提供可靠的医学教育.
- 人工智能工具可能无法依赖于帮助学习者在复杂的,分专业特定的患者决策场景中.
- 需要进一步发展,以提高医疗培训的AI准确性和全面性.


