插件增强聊天GPT的性能及其量化不确定性的能力:对德国医学委员会考试的模拟研究
Julian Madrid1, Philipp Diehl1, Mischa Selig2,3
1Department of Cardiology, Pneumology, Angiology, Acute Geriatrics and Intensive Care, Ortenau Klinikum, Klosterstrasse 18, Lahr, 77933, Germany, 49 7821932403.
JMIR medical education
|March 21, 2025
概括
像GPT-4这样的大型语言模型证明了医疗委员会能力,超过了最低门. 虽然它们可以量化响应不确定性,但过度自信仍然是临床AI应用的挑战.
科学领域:
- 人工智能在医学中的应用
- 医疗教育 技术 技术 医学教育
- 自然语言处理自然语言处理.
背景情况:
- 像GPT-4这样的大型语言模型 (LLM) 显示出越来越多的兴趣和建议的应用.
- 目前的LLM在符号表示和访问实时数据方面存在局限性.
- 有插件的GPT-4旨在解决这些局限性.
研究的目的:
- 评估GPT-3.5,GPT-4和GPT-4与插件在德国医学委员会考试.
- 评估LLM在医疗环境中量化不确定性的能力.
- 开发一种"信心准确度"指标,用于评估LLM的不确定性量化.
主要方法:
- GPT模型回答了德国医学委员会考试中的问题.
- 分析包括答案的理由,答案的准确性和错误结构.
- 引导和置信区间评估了统计学意义.
主要成果:
- GPT模型超过了医疗委员会认证的最低能力值.
- 模型显示不确定性量化,但表现出过度自信.
- 在GPT生成的答案中观察到明显的理由和推理模式.
结论:
- 在医学问答方面GPT的高表现表明了学术和临床潜力.
- 不确定性量化能力将人工智能定位为一种有价值的临床决策工具.
- 对于医疗领域的强大和安全的人工智能实施,仍然存在重大挑战.


