大型语言模型改善了对症状性结石的急诊室访问的识别
Cosmin A Bejan1, Amy M Reed2, Matthew Mikula2
1Department of Biomedical Informatics, Vanderbilt University School of Medicine, Vanderbilt University Medical Center, 2525 West End Avenue, Suite 1500, Nashville, TN, 37232, USA. adi.bejan@vanderbilt.edu.
Scientific reports
|January 28, 2025
概括
大型语言模型 (LLM) 在分析急诊室关于结石的报告方面表现有前途. GPT-4实现了最佳性能,在临床应用中展示了准确性和公平性.
科学领域:
- 人工智能在医学中的应用
- 临床自然语言处理 临床自然语言处理
- 机器学习用于医疗保健
背景情况:
- 像GPT-4这样的大型语言模型 (LLM) 正在快速发展,但它们的临床实用性尚未得到充分探索.
- 分析急诊室 (ED) 报告对于识别诸如症状性结石等疾病至关重要.
- 在紧急医疗中,LLM在临床决策支持方面的潜力需要进行彻底的调查.
研究的目的:
- 评估LLM和传统机器学习模型在分析结石ED报告中的有效性.
- 探索提高LLM绩效的策略,包括快速工程和微调.
- 评估临床数据分析中LLMs关于种族和性别的公平性和潜在偏见.
主要方法:
- 使用手动注释ED报告的数据集进行培训和评估.
- 实施并比较各种LLM增强策略:快速优化,零/少数镜头提示,微调和快速增强.
- 进行公平性评估和偏见缓解,并对LLM生成的解释进行专家临床审查.
主要成果:
- GPT-4获得了最高的性能 (宏F1 = 0.833),在识别结石相关的急救诊所时,其表现优于其他模型.
- 微调显著提高了GPT-3.5模型的性能.
- 纳入人口统计信息和先前的病史增强了LLM决策准确性. 与GPT-3.5.5.不同的是,GPT-4没有显著的种族或性别偏见.
结论:
- 在紧急情况下,LLM,特别是GPT-4,显示出分析临床文本的巨大潜力,特别是用于识别结石.
- 快速工程和微调是优化医疗保健应用中的LLM性能的有效策略.
- 确保LLM的公平性和减轻偏见对于公平的临床部署至关重要,GPT-4在这方面表现出卓越的表现.


