大型语言模型改善了对症状性结石的急诊室访问的识别
medRxiv : the preprint server for health sciences
|August 30, 2024
概括
像GPT-4这样的大型语言模型可以准确地分析急诊室报告以识别结石,优于传统方法. GPT-4没有种族或性别偏见,证明了其临床应用的潜力.
科学领域:
- 人工智能的人工智能
- 临床信息学 临床信息学
- 医学自然语言处理 医学自然语言处理
背景情况:
- 大型语言模型 (LLM) 显示出临床应用的前景.
- 它们分析急诊室 (ED) 关于结石等特定疾病的报告的能力在很大程度上是未被探索的.
- 本研究对传统的机器学习和ICD代码进行了LLM的评估.
研究的目的:
- 调查多个LLM (GPT-4,GPT-3.5,Llama-2) 在分析症状结石ED报告中的性能.
- 将LLM的性能与传统的机器学习模型和基于ICD代码的系统进行比较.
- 评估有关种族和性别的LLM预测中的公平性和偏见.
主要方法:
- 使用ED报告的手动注释数据集.
- 雇佣的提示优化,零/少数镜头提示,微调,并为LLMs的提示增强.
- 进行公平性评估和偏见缓解.
- 临床专家评估了GPT-4的解释的合理性和事实上的正确性.
- 将LLM与后勤回归,XGBoost,LGBM和ICD代码基线进行比较.
主要成果:
- GPT-4 (宏F1=0.833) 和GPT-3.5 (宏F1=0.796) 的表现明显超过了ICD基线 (宏F1=0.71).
- 微调改进了 GPT-3.5 的性能.
- 包括人口统计和先前的病史,提高了LLM的准确性.
- 与GPT-3.5.5.不同的是,GPT-4没有表现出任何种族或性别偏见.
- GPT-4的解释表明了强大的临床文本理解和推理.
结论:
- LLM,特别是GPT-4,显示出在急诊室准确分析临床笔记的巨大潜力.
- GPT-4表现出强大的性能,公平性和健全的临床推理能力.
- 需要进一步开发和验证,以将LLM整合到临床工作流程中,以治疗诸如结石等疾病.


