使用大型语言模型在长度临床记录中对健康社会决定因素的复杂案例进行注释
Alexandra Ralevski1, Nadaa Taiyab2, Michael Nossal3
1Institute for Systems Biology, 401 Terry Ave N, Seattle, WA, 98109, USA.
像GPT-4这样的大型语言模型 (LLM) 在从临床笔记中识别孕妇的住房不稳定性方面表现有前途. 虽然不是完全自动化的,但LLM提供了可扩展的,具有成本效益的计算机辅助注释,比手动方法更容易回忆.
科学领域:
- 医疗信息学 医疗信息学
- 公共卫生 公共卫生
- 计算语言学 计算语言学
背景情况:
- 健康的社会决定因素 (SDoH),特别是住房稳定性,显著影响健康结果,尤其是孕妇.
- 电子健康记录 (EHR) 包含关键的SDoH数据,但它通常是非结构化的自由文本,挑战传统的NLP方法.
- 住房状况可能是主观和可变的,使得从临床笔记中提取准确数据变得复杂.
研究的目的:
- 为了比较GPT-3.5和GPT-4在识别住房不稳定的有效性 (当前,过去和一般状态) 从非结构化的EHR临床笔记.
- 评估LLM性能与手动注释,命名实体识别 (NER) 和正则表达式 (RegEx) 相比.
- 评估LLM在医疗保健中可扩展,具有成本效益的SDoH数据提取的潜力.
主要方法:
- 利用一个安全的医疗保健系统平台,分析了来自795名孕妇的25217份临床记录.
- 为LLMs (GPT-3.5,GPT-4) 开发了一个思维链提示,以确保基于证据的,合理的注释.
- 将LLM输出与手动注释,NER模型和RegEx进行比较,以获得准确性,回忆力和精度.
主要成果:
- 在识别住房不稳定性方面,GPT-4表现最出色,回忆力明显高 (0.924) 比人类注释器 (0.702).
- GPT-4的精度 (0.850) 比人类注释器 (0.971) 低,差异往往来自模两可或主观的住房情况.
- 通过LLM生成的证据与人类注释器非常相匹配,没有观察到GPT-4的幻觉;取消识别的数据显示精度略有提高,但回忆力有所降低.
结论:
- LLM,特别是GPT-4,提供了一个可扩展和具有成本效益的方法,用于计算机辅助注释来自EHR的SDoH数据,增强回忆.
- 虽然手册注释仍然更精确,但LLMs可以显著改善住房不稳定的识别,帮助积极的患者推广.
- 需要进一步的研究来解决潜在的偏见,错过的病例,以及在临床环境中完全自动化的LLM应用的局限性,强调人类审查的价值.
更多相关视频
07:50A Metadata Extraction Approach for Clinical Case Reports to Enable Advanced Understanding of Biomedical Concepts
Published on: September 20, 2018
08:51Author Spotlight: Integrated Multi-Omics Analysis for Unveiling Multicellular Immune Signatures in Clinical Heart Attack Cohorts
Published on: September 20, 2024
相关概念视频
Longitudinal Studies
Longitudinal Research
Methods of Documentation VI: Case Management Model
For example, a patient with a chronic...
Genome-wide Association Studies-GWAS
GWAS does not require the identification of the target gene involved in...
Introduction to Epidemiology
Mechanistic Models: Compartment Models in Individual and Population Analysis
