匹配人类专业知识:ChatGPT在手术手术检查上的表现
Zachary A Kirschenbaum1, Yuri Han1, Kiera L Vrindten1
1Rutgers Robert Wood Johnson Medical School, New Brunswick, NJ, USA.
概括
像ChatGPT 4o这样的人工智能 (AI) 工具在手术考试中表现相当于人类,特别是在改进的提示和文献访问的情况下. 这表明人工智能有助于医学教育和实践的潜力.
科学领域:
- 人工智能在医学中的应用
- 医疗教育 技术 技术 医学教育
- 手术评估工具 手术评估工具
背景情况:
- 人工智能 (AI) 在医疗保健中的整合正在迅速推进,像ChatGPT这样的工具显示出承诺.
- 以前的评估表明,与手术自我评估考试的人类专家相比,ChatGPT 3.5的表现不佳.
- 该研究解决了需要评估在专业医疗领域的新人工智能能力的需求.
研究的目的:
- 为了评估ChatGPT 4o在美国手术协会 (ASSH) 自我评估问题上的表现.
- 确定增强技术,如改进提示和文件搜索,是否可以提高AI的准确性.
- 将ChatGPT 4o的性能与之前的版本和人类基准进行比较.
主要方法:
- 利用了来自ASSH自我评估考试 (2008-2013) 的数据.
- 通过OpenAI的API调查了ChatGPT模型版本,提示工程和文件搜索对响应准确性的影响.
- 使用单向ANOVA进行统计分析,并用KR-20评估测试可靠性.
主要成果:
- 聊天GPT 4o,特别是通过增强提示和文献访问,在基于文本的问题上实现了与人类可比的性能.
- 聊天GPT 4o显著优于聊天GPT 3.5,并通过高级提示和文件搜索显著改进.
- 2013年的检查显示了高可靠性,KR-20得分为0.946.
结论:
- 人工智能,特别是ChatGPT 4o,可以在专门的手术自我评估检查中以人类相当的水平进行.
- 研究结果表明,人工智能作为医学教育中宝贵的补充工具的潜力.
- 人工智能工具可以为临床实践和专业发展提供支持资源.


