大型语言模型在复杂临床病例中的应用:横截面评估研究
Yuanheng Huang1, Guozhen Yang1, Yahui Shen2
1Department of Cardiothoracic Surgery, Third Affiliated Hospital of Sun Yat-sen University, 2693 Kaichuang Avenue, Huangpu District, Guangzhou, 510000, China, 86 13922192727, 86 82179042.
JMIR medical informatics
|October 7, 2025
概括
大型语言模型 (LLM) 显示了医疗决策支持的巨大潜力,比人类专家提供更快,更具成本效益的解决方案. 对于临床应用,GPTo1和Deepseek-R1特别有前途.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 临床决策支持系统 临床决策支持系统
背景情况:
- 大型语言模型 (LLM) 对医疗应用有希望,但面临挑战.
- 自然语言处理 (NLP) 的进步推动了LLM的发展.
- 将LLMs纳入临床实践需要仔细评估.
研究的目的:
- 在复杂的医疗病例中评估LLM的效率,准确性和成本效益.
- 评估LLM作为临床决策支持工具的潜力.
- 将LLM绩效与传统的专家决策进行比较.
主要方法:
- 用心胸外科手术80个复杂病例对多个LLM进行评估.
- 评估LLM决策时间,准确性 (利克尔特分数) 和成本.
- 对LLM绩效指标与专家决策时间进行比较.
主要成果:
- 在决策速度方面,LLM显著超过专家 (不到4分钟,而不是33.6分钟).
- 与其他模型相比,Deepseek-R1和GPTo1显示出更高的准确性和更低的幻觉率.
- 所有评估的LLM都比多学科团队的决策成本要低得多,像Deepseek-R1这样的开源模型提供零直接成本.
结论:
- 由于提高效率,准确性和降低成本,GPTo1和Deepseek-R1具有强大的临床潜力.
- GPT4o和Kimi表现中等,适合更广泛的临床任务.
- 在临床决策中需要进一步验证LLaMa3系列和Gemini模型.
更多相关视频
04:04Asthma Detection Research Based on Voice Signal Processing and Machine Learning
Published on: July 22, 2025
926
06:22Machine Learning-Based Cough Tone Classification: Diagnostic Exploration of Chronic Obstructive Pulmonary Disease and Respiratory Tract Infections
Published on: September 19, 2025
432
