一项试点可行性研究,比较大型语言模型,从爱尔兰人口的ICU患者文本记录中提取关键信息
Emma Urquhart1, John Ryan2, Sean Hartigan2
1School of Computer Science, University of Galway, Galway, Ireland.
Intensive care medicine experimental
|August 15, 2024
概括
大型语言模型 (LLM) 显示了总结重症监护室 (ICU) 退院摘要的潜力. 与ChatGPT和Llama 2相比,GPT-4 API在准确性和组织性方面表现出更好的表现,尽管所有模型都需要进一步改进.
科学领域:
- 人工智能在医学中的应用
- 临床信息学 临床信息学
- 自然语言处理自然语言处理.
背景情况:
- 人工智能 (AI) 提供了增强数据管理和在重症监护室 (ICU) 的自动总结的潜力.
- 大型语言模型 (LLM) 可以处理广泛的医疗笔记以生成简洁的出院摘要.
研究的目的:
- 调查LLM在准确而简洁地合成重症监护室 (ICU) 退院摘要方面的能力.
- 为了比较不同LLM在生成临床相关和组织良好的摘要方面的表现.
主要方法:
- 匿名的ICU临床笔记被用于训练和验证三个LLM中的提示结构:ChatGPT,GPT-4 API和Llama 2.
- 员工密集医生根据关键临床事件的识别和排序,可读性,组织性,简洁性和整体排名来判断生成的摘要.
主要成果:
- 在识别预定义的临床事件方面,GPT-4 API获得了最高的准确性 (41.5%),明显超过了ChatGPT (19.2%) 和Llama 2 (16.5%).
- 与Llama 2相比,GPT-4 API和ChatGPT在事件排序,可读性,组织性和简洁性方面得分更高.
- GPT-4 API产生了其他模型中缺少的轻微幻觉.
结论:
- 在总结质量,事件序列和数据捕获方面,LLM之间存在显著的性能差异.
- 所有评估的LLM都表现出叙事连贯性的挑战,并遗漏了关键的临床数据.
- 尽管存在局限性,但LLM在未来开发高效的ICU出院总结方面显示出有前途的潜力.


