大型语言模型从临床文本识别症状:多中心研究
Andrew J McMurry1,2, Dylan Phelan1, Brian E Dixon3,4
1Computational Health Informatics Program, Boston Children's Hospital, 401 Park Drive, LM5506, Mail Stop BCH3187, Boston, MA, 02215, United States, 1 617-355-4145.
Journal of medical Internet research
|July 31, 2025
概括
大型语言模型 (LLM) 在电子健康记录中准确识别传染性呼吸道疾病症状,优于传统方法. 在多个医疗保健环境中,GPT-4表现出卓越的准确性和通用性.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 临床自然语言处理 临床自然语言处理
背景情况:
- 患者的症状识别对医学,研究和公共卫生至关重要.
- 尽管在医生笔记中记录了这些症状,但在编码数据中往往报告不足.
- 大型语言模型 (LLM) 通过模仿人类图表审查员来识别症状的潜力.
研究的目的:
- 根据图表审查指南,衡量LLM在识别传染性呼吸道疾病症状方面的准确性.
- 评估LLM在不同医疗保健场所的通用性,而无需进行特定场所的调整.
主要方法:
- 四名法学士 (GPT-4,GPT-3.5,Llama2 70B,Mixtral 8×7B) 被要求担任图表审查员.
- 使用开发集体优化了LLM的性能,并与专家注释的地面真相进行了测试.
- 通过来自多个急救部门的验证库,评估了LLM的通用性.
主要成果:
- 所有测试的LLM都显著超过了基于国际疾病分类第十次修订 (ICD-10) 的方法 (F1-score=45.1%).
- GPT-4获得了最高的准确性 (F1分数=91.4%),并在验证集体中显示出优异的概括性 (F1分数=94.0%),超过了ICD-10方法 (F1分数=26.9%).
- 在识别症状方面,LLM表现出很高的准确性,GPT-4显著优于其他模型和基线方法.
结论:
- 与ICD-10方法相比,LLM显著提高了电子健康记录中的呼吸系统症状识别.
- GPT-4具有很高的准确性和通用性,这表明它有可能增强或取代传统的症状识别方法.
- 在症状识别方面,LLM可以有效地模仿人类图表审核人员,因此需要对更广泛的症状类型和临床环境进行进一步调查.
关键词:
人工智能的人工智能是人工智能.临床文本挖掘 临床文本挖掘电子健康记录是电子健康记录.紧急医疗服务 紧急医疗服务流行病学方法 流行病学方法传染病监测 传染病监测 传染病监测 传染病监测大型语言模型.医疗信息学是一门医学信息学专业.自然语言处理自然语言处理.症状识别 症状识别

