相关实验视频
Updated: Jul 10, 2026

08:39
Culture of Bladder Cancer Organoids as Precision Medicine Tools
Published on: December 28, 2021
5.3K
评估大型语言模型的可靠性,用于在膀癌预后中提取临床数据
Di Sun1, Lubomir Hadjiiski2, Grace Bruno2
1Department of Radiology, University of Michigan, Ann Arbor, MI, USA. disun@umich.edu.
Scientific reports
|November 21, 2025
概括
大型语言模型 (LLM) 显示出从电子病历 (EMR) 中提取临床数据以预测膀癌生存率的前景. 虽然GPT-4和Llama模型提供了高准确度,但仍然存在变性挑战.
科学领域:
- 人工智能的人工智能
- 医疗信息学 医疗信息学
- 在瘤学瘤学.
背景情况:
- 自然语言处理 (NLP) 和机器学习可以帮助从电子病历 (EMR) 提取临床数据.
- 准确提取临床信息对于预测建模至关重要,特别是在瘤学中.
研究的目的:
- 评估各种大型语言模型 (LLM) 在从EMR中提取膀癌生存数据的准确性和一致性.
- 评估影响LLM绩效的因素,包括模型类型,培训数据,输入长度和数据序列.
主要方法:
- 使用了163名膀癌患者的EMR.
- 多个LLM (Dolly,Vicuna,Llama,GPT-4) 的性能指标 (Fleiss' Kappa,精度,AUC) 的比较.
- 分析了模型变化和输入特征对提取和预测准确性的影响.
主要成果:
- 在临床数据提取和生存预测方面,GPT-4实现了高准确度 (>93%) 和可靠性 (Fleiss' Kappa>0.97).
- 拉玛-2.0-13b和拉玛-3.3-70b在离线模型中表现出强的表现.
- 根据模型类型,培训,输入长度和序列,LLM的性能有所不同.
结论:
- LLM具有显著的潜力,用于自动化临床数据提取,以预测膀癌生存率.
- 确保LLM可靠性和解决变异性是临床实施的关键挑战.
- 需要进一步的研究来优化LLM的性能和整合到临床工作流程.

