模型演变和系统角色对ChatGPT在中国医疗执照考试中的表现的影响:比较研究
Shuai Ming1,2,3, Qingge Guo1,2,3, Wenjun Cheng4
1Department of Ophthalmology, Henan Eye Hospital, Henan Provincial People's Hospital, Zhengzhou, China.
JMIR medical education
|August 14, 2024
概括
在中国国家医疗执照考试 (CNMLE) 中,GPT-4.0表现优异,以72.7%的准确度超过了合格门. 这种先进的AI显示出医学教育和实践的巨大潜力.
科学领域:
- 人工智能在医学中的应用
- 在医疗保健中的自然语言处理.
背景情况:
- 像ChatGPT这样的大型语言模型 (LLM) 越来越多地在各个行业中使用.
- 它们在医学领域的应用,特别是用于标准化检查,是越来越多的研究兴趣领域.
研究的目的:
- 在中国国家医疗执照考试 (CNMLE) 上评估ChatGPT的临床性能.
- 在高风险的医疗许可环境中评估ChatGPT的准确性和可靠性.
主要方法:
- 使用的是2022年中国国家医疗执照考试 (CNMLE) 问卷组 (500个选择题).
- 问题被分为15个医学子专业,并根据GPT-3.5和GPT-4.0.0进行测试.
- 根据医疗子专业量身定制的系统角色和响应重复被分析到对准确性和一致性的影响 (通过值:60%).
主要成果:
- GPT-4.0实现了72.7%的准确性,显著超过了GPT-3.5 (54%,P<.001).
- GPT-4.0表现出较低的响应变异性 (9%与19.5%,P<.001),并在15个子专业中的14个中通过.
- 系统角色对两种模型的准确性略有提高,变异性降低,响应一致性良好 (GPT-4.0的κ=0.778,GPT-3.5的κ=0.610).
结论:
- GPT-4.0成功通过了CNMLE,显示出比GPT-3.5.5更高的准确性,一致性和子专业专业知识.
- 虽然系统角色的影响很小,但GPT-4.0对医学教育和临床应用有很大的前景.
- 需要进一步的研究来探索先进的人工智能模型在医学评估中的全部潜力.
关键词:
聊天GPT 聊天 在GPT 聊天中国中国中国中国.华人中文 华人中文是什么意思中国国家医疗执照考试在法学士 (LLM) 课程中.在法律上,LLMs.开放AI是一个开放的AI.准确度 准确度 准确度 准确度答案 答案 答案 答案 答案答案 答案 答案 答案 答案 答案人工智能的人工智能是人工智能.聊天机器人 聊天机器人聊天机器人聊天机器人聊天机器人交谈代理人是一个对话代理人.交谈代理人 交谈代理人考试 考试 考试 考试 考试考试 考试 考试 考试考试 考试 考试 考试 考试考试 考试 考试 考试语言模型语言模型语言模型语言模型大型语言模型.医学教育 医学教育业绩表现表现的表现表现是什么响应 响应 响应 响应答案 答案 响应 响应系统角色 系统角色

