评估大型语言模型的能力:GPT-4在外科知识评估上的表现
Brendin R Beaulieu-Jones1, Margaret T Berrigan2, Sahaj Shah3
1Department of Surgery, Beth Israel Deaconess Medical Center, Boston, MA; Department of Biomedical Informatics, Harvard Medical School, Boston, MA. Electronic address: https://twitter.com/bratogram.
Surgery
|January 21, 2024
概括
像ChatGPT这样的人工智能 (AI) 模型在外科知识测试中显示出接近人类水平的性能. 然而,对重复查询的不一致答案引起了对安全临床使用的担忧.
科学领域:
- 人工智能在医学中的应用
- 医疗教育 技术 技术 医学教育
- 手术知识评估评估手术知识评估
背景情况:
- 人工智能 (AI) 在医疗保健,特别是诊断和治疗方面提供了变革性的潜力.
- 像ChatGPT这样的大型语言模型 (LLM) 在各种基准上展示了先进的功能.
- 在外科手术等专业医疗领域评估AI性能至关重要.
研究的目的:
- 评估ChatGPT在手术知识问题上的表现.
- 评估ChatGPT对重复查询的响应的一致性.
- 识别在外科知识评估中导致AI错误的因素.
主要方法:
- 通过使用两个手术知识问题库 (外科住院教育委员会和Data-B) 测试了ChatGPT-4.
- 问题以开放式和多项选择形式呈现.
- 外科医生评估者评估了ChatGPT输出的准确性和洞察力,对错误进行分类并分析响应稳定性.
主要成果:
- 在外科住院教育银行上,ChatGPT实现了71.3% (多选项) 和47.9% (开放式) 的准确率.
- 在Data-B银行,准确率为67.9% (多选项) 和66.1% (开放式).
- 大约三分之二的答案提供了有价值的见解,但在重复查询时,答案准确性有显著差异 (37.5%的错误答案变化).
结论:
- 聊天GPT在手术知识评估方面表现接近人类水平,特别是在多选格式中.
- 对重复查询的不一致答案突出了直接临床应用的局限性.
- 需要进一步开发以确保AI工具在医疗保健环境中的安全性和可靠性.


