大型语言模型对专家级重症监护问题的比较评估和性能:一个基准研究
Jessica D Workum1,2,3, Bas W S Volkers1,3, Davy van de Sande1,3
1Department of Adult Intensive Care, Erasmus MC University Medical Center, Rotterdam, The Netherlands.
Critical care (London, England)
|February 10, 2025
概括
大型语言模型 (LLM) 在重症监护医学中显示出高精度,其中四种模型在考试中表现优于医生. 然而,一致的错误答案强调了在临床使用前需要仔细评估的必要性.
科学领域:
- 人工智能在医学中的应用
- 关键护理医学 关键护理医学
- 机器学习绩效评估 机器学习绩效评估
背景情况:
- 大型语言模型 (LLM) 对医疗保健应用有希望,包括行政支持和临床决策.
- 有限的数据存在于LLM表现,特别是在重症监护医学领域.
- 这项研究解决了在重症监护机构了解法学士能力方面的差距.
研究的目的:
- 评估五个领先的大型语言模型 (LLMs) 在重症监护医学中的表现.
- 为了比较LLM准确性和一致性与人类医生和随机猜测.
- 分析成本作为能源消耗和特定领域性能的代理.
主要方法:
- 五个LLM (GPT-4o,GPT-4o-mini,GPT-3.5-turbo,Mistral Large 2407,Llama 3.1 70B) 在一个重症监护数据库中的1181个多选择题 (MCQ) 上进行了测试.
- 性能与随机猜测和350名人类医生使用77-MCQ实践测试进行了基准测试.
- 关键指标包括准确性,一致性,特定领域的性能和成本分析.
主要成果:
- GPT-4o实现了最高的精度 (93.3%),超过了所有其他模型和人类医生.
- 在实践测试中,四名LLM在实践测试中表现优于人类医生,GPT-3.5-turbo表现相似.
- 尽管准确度很高,但所有模型都表现出一致的错误,GPT-4o的成本明显更高.
结论:
- 在重症监护医疗中,LLM表现出了卓越的准确性和一致性,具有帮助临床医生的巨大潜力.
- 四个评估的LLM在欧洲一级的实践考试中超过了人类医生的表现.
- 关于一致错误和能耗 (成本) 的担忧需要进一步严格评估,以确保安全的临床实施.


