大型语言模型在医学瘤学检查问题上的表现
Jack B Longwell1, Ian Hirsch1,2, Fernando Binder1,2
1Princess Margaret Cancer Centre, University Health Network, Toronto, Ontario, Canada.
JAMA network open
|June 18, 2024
概括
大型语言模型 (LLM) 在回答医疗瘤学问题方面表现有前途,最好的模型达到85%的准确性. 然而,错误的答案带来了显著的临床危害风险,强调了需要仔细评估的必要性.
科学领域:
- 人工智能在医学中的应用
- 临床决策支持系统 临床决策支持系统
- 医疗教育 技术 技术 医学教育
背景情况:
- 大型语言模型 (LLM) 展示了先进的问答能力,但它们在医学瘤学等专业领域的表现仍未得到评估.
- 医疗瘤学需要快速吸收新信息,这给LLM的概括性带来了独特的挑战.
研究的目的:
- 评估医学瘤学考试问题的LLM生成答案的准确性和安全性.
- 在这个高风险领域识别与LLM不准确性相关的潜在临床风险.
主要方法:
- 一项横截面研究评估了8个LLM,使用美国临床瘤学会 (ASCO) 和欧洲医学瘤学会 (ESMO) 考试中的问题,以及原始的板式问题.
- 医疗瘤学家审查了最好的LLM对准确性,错误类型和潜在临床危害的解释.
主要成果:
- 专有LLM 2的准确率达到了85.0%,明显超过其他LLM.
- 最好的LLM的解释在很大程度上是准确的 (93.9%),但错误往往源于信息检索问题,特别是最近的数据.
- 很大一部分 (81.8%) 错误的答案带来了中等到高的可能造成中度到严重的临床伤害.
结论:
- 虽然LLM在瘤学考试中显示出高准确度,但其错误引发了严重的安全问题.
- 进一步开发和严格评估LLM对于安全融入医疗保健至关重要,以提高临床医生的经验和患者护理.
更多相关视频
04:09Predicting Treatment Response to Image-Guided Therapies Using Machine Learning: An Example for Trans-Arterial Treatment of Hepatocellular Carcinoma
Published on: October 10, 2018
8.2K
07:15Machine Learning Algorithms for Early Detection of Bone Metastases in an Experimental Rat Model
Published on: August 16, 2020
6.8K
