一个新的评估模型,用于评估ChatGPT的耳鼻喉科-头部和部外科认证考试:绩效研究研究
Cai Long1, Kayle Lowe2, Jessica Zhang2
1Division of Otolaryngology-Head and Neck Surgery, University of Alberta, Edmonton, AB, Canada.
JMIR medical education
|January 16, 2024
概括
聊天GPT通过了耳鼻喉科 - 头部手术 (OHNS) 样本考试,显示了认证的潜力. 然而,人工智能模型幻觉需要进一步调整以确保安全的临床使用.
科学领域:
- 人工智能在医学中的应用
- 医疗教育 技术 技术 医学教育
背景情况:
- 像ChatGPT这样的大型语言模型 (LLM) 在标准化测试中表现出色,但它们在耳鼻喉科-头手术 (OHNS) 认证考试中的表现是未知的.
- 开放式的医疗委员会检查尚未对AI性能进行评估.
研究的目的:
- 评估ChatGPT在OHNS委员会考试中的表现.
- 引入一种新的方法来评估AI在开放式医学问题上的表现.
主要方法:
- 从加拿大皇家医生和外科医生学院的样本检查中,ChatGPT被查询了21个开放式问题.
- 开发了一种新的评估模型,即一致性,有效性,安全性,能力 (CVSC).
主要成果:
- 在样本OHNS考试中,ChatGPT获得了通过分数 (平均75%),在使用提示时准确度提高.
- 人工智能模型表现出高一致性 (92.06%) 和令人满意的有效性,但表现出幻觉和自我冲突的答案.
结论:
- 聊天GPT显示出通过OHNS认证考试的潜力,但需要进一步改进以解决与幻觉相关的安全问题.
- 确保AI的准确性和安全性对于医学中成功的临床实施至关重要.
关键词:
在这里,我们可以看到AIAIAI.聊天GPT 聊天 在GPT 聊天ENT ENT ENT ENT ENT ENT ENT ENT ENT ENT ENT ENT ENT ENT ENT ENT ENT ENT ENT ENT ENT ENT ENT法学士 (LLM) 是一个专业.在法律上,LLMs.在NLP中,我们使用了NLP.美国OHNS OHNS答案 答案 答案 答案 答案答案 答案 答案 答案 答案 答案人工智能的人工智能是人工智能.聊天机器人 聊天机器人聊天机器人聊天机器人聊天机器人临床实施 临床实施耳朵 耳朵 耳朵 耳朵考试 考试 考试 考试 考试考试 考试 考试 考试考试 考试 考试 考试 考试考试 考试 考试 考试语言模型语言模型大型语言模型.喉科 喉科 喉科机器学习是机器学习.医学教育 医学教育医疗检查 医学检查医疗许可证 医疗许可证自然语言处理自然语言处理.鼻子 鼻子 鼻子 鼻子耳鼻喉科 耳鼻喉科 耳鼻喉科耳鼻喉科/头部和部外科手术耳道学 耳道学是指耳道学.患者安全 患者安全响应 响应 响应 响应答案 答案 响应 响应在安全方面,安全是安全的.手术 手术 手术 手术 手术 手术 手术这是一个外科手术.喉 喉 喉 喉 喉 喉 是一个有广泛的信息信息范围.

