快速工程将提高GPT3.5在整形外科现役考试中的表现
George R Nahass1, Sydney W Chin2, Isabel M Scharf2
1The Craniofacial Center, Division of Plastic, Reconstructive, and Cosmetic Surgery, University of Illinois at Chicago, Chicago, IL 60612, USA; Richard and Loan Hill Department of Biomedical Engineering, University of Illinois at Chicago, Chicago, IL 60612, USA.
Journal of plastic, reconstructive & aesthetic surgery : JPRAS
|September 10, 2024
概括
聊天GPT (GPT-3.5) 在整形手术考试中表现有限,得分在第10个百分点. 快速工程和检索增强生成 (RAG) 并没有显著提高其准确性,突出了医学中先进AI开发的需要.
科学领域:
- 医学教育 医学教育
- 人工智能在医学中的应用
- 自然语言处理自然语言处理.
背景情况:
- 像ChatGPT (GPT-3.5) 这样的人工智能 (AI) 工具越来越多地被用于医疗应用.
- 在标准化医疗检查中评估AI性能对于了解它们的潜力和局限性至关重要.
研究的目的:
- 评估ChatGPT (GPT-3.5) 在2021年美国塑料外科医生协会 (ASPS) 现役检查中的表现.
- 调查快速工程 (角色扮演) 和检索增强生成 (RAG) 对AI准确性的影响.
主要方法:
- 聊天GPT (GPT-3.5) 使用不同的提示模拟角色进行了测试:住院医生,主治医生和医学学生.
- 检索增强生成 (RAG) 使用策划的矢量数据库来提供上下文信息.
- 绩效是根据2021年ASPS塑料外科在职检查的准确性进行评估的.
主要成果:
- 当被提示为"居民"时,ChatGPT的最高准确率为54%.
- 检索增强生成 (RAG) 并没有改善性能,准确度保持在54.3%.
- 与人类测试对象相比,AI的整体表现将其置于第10个百分位.
结论:
- 目前的AI模型,如ChatGPT (GPT-3.5),在专门的医学检查中表现不佳.
- 快速修改和RAG本身不足以提高AI对复杂的医疗知识任务的实用性.
- 对人工智能微调和先进方法的进一步研究是必要的,以便有效地融入医疗实践.


