评估使用大型语言模型进行零射击提示的有效性,用于提取微生物疹炎描述剂
Lokeshwari Aruljyothi1, Tushar Mungle2, Maria A Woodward3
1Department of Cornea and Refractive Services, Aravind Eye Hospital, Salem, Tamil Nadu, India.
Cornea
|December 11, 2025
概括
像GPT-4o这样的大型语言模型 (LLM) 从临床笔记中有效提取微生物角质炎 (MK) 描述符,与人类专家有很好的一致性. 法律学士学位的表现取决于电子健康记录数据的质量.
科学领域:
- 眼科医生 眼科 眼科
- 医疗信息学 医疗信息学
- 人工智能的人工智能
背景情况:
- 微生物角膜炎 (MK) 是视力丧失的重要原因之一.
- 从临床笔记中准确地提取MK描述符对于患者护理和研究至关重要.
- 电子健康记录 (EHR) 包含有价值的临床信息,但通常需要复杂的数据提取方法.
研究的目的:
- 评估大型语言模型 (LLM) 在从临床医生笔记中提取微生物角质炎 (MK) 描述物的有效性.
- 将LLM生成的描述符与专家人类注释员使用零射击提示方法识别的描述符进行比较.
- 评估GPT-4o和GPT-4o mini在识别MK特征,如中心性,透深度和稀释方面的性能.
主要方法:
- 分析了215名具有培养证明的MK患者的数据集.
- 从第一次角膜检查中使用的自由文本临床笔记用于描述符提取.
- 提示GPT-4o和GPT-4o迷你识别中心性,透深度和稀释,结果与使用科恩·卡帕分数,灵敏度和特异性的专家共识相比较.
主要成果:
- 对于MK描述器,GPT-4o实现了高平均灵敏度 (92-97%) 和特异性 (93-99%).
- 科恩·卡帕对GPT-4o的评分表明与人类注释 (0.73-0.88) 有很好的一致性.
- GPT-4o mini表现低于GPT-4o,尽管在统计学上并不显著,但突出显示了LLM架构中的潜在权衡.
结论:
- 包括GPT-4o和GPT-4o mini在内的LLM显示出与用于提取MK描述符的人类注释有相当大的一致性.
- 基于LLM的提取的准确性受到EHR文档的质量和一致性的影响.
- 在实施LLMs进行大规模分析MK数据时,考虑效率-性能权衡是必不可少的.


