大型语言模型的准确性,以在非结构化的电子健康记录数据中识别中风亚型
Dylan Owens1, Danh Q Nguyen1, Michael Dohopolski2,3
1Department of Medicine, UT Southwestern Medical Center, Dallas, TX. (D.O., D.Q.N., E.D.P., A.M.N.).
Stroke
|July 25, 2025
概括
像GPT-4o这样的大型语言模型可以从临床笔记中准确地分类中风类型. 然而,确定特定的缺血性中风亚型仍然是AI在医疗保健中的挑战.
科学领域:
- 医疗信息学 医疗信息学
- 人工智能在医学中的应用
- 临床数据分析 临床数据分析
背景情况:
- 从电子健康记录中准确地分类中风是很困难的,因为结构化数据有限.
- 临床文档的手动审查通常需要精确的冲击类型.
- 这项研究调查了大型语言模型对于自动化中风分类的实用性.
研究的目的:
- 评估GPT-4o在分类中风类型 (缺血性与出血性) 和缺血性中风亚型中的准确性.
- 在此任务中评估GPT-4o不同提示策略的性能.
- 将人工智能驱动的分类与专家手工抽象进行比较.
主要方法:
- 使用GPT-4o的检索增强生成框架被开发用于中风分类.
- 来自美国心脏协会的数据被用作黄金标准.
- 三种提示策略 (零射击思维链,专家指导,基于指令) 在两个卫生系统的EHR数据上进行了测试.
主要成果:
- 在外部验证中,GPT-4o在分类中风类型 (缺血与出血) 中实现了98%的准确性.
- 对中风类型分类的敏感性和特异性高 (分别为0.98和0.97).
- 缺血性中风亚型的表现不同,心血管栓塞的高精度 (0.98特异性),但对于密码性中风 (0.40敏感性) 的精度较低.
结论:
- GPT-4o在区分缺血性和出血性中风类型方面表现出很高的准确性.
- 该模型在准确分类各种缺血性中风亚型方面存在局限性.
- 零射击思维链提示被证明是有效的,需要最小的人类投入.


