对比域特定与通用语言模型的质量,用于人工智能生成的PICU患者的差异诊断
Alireza Akhondi-Asl1,2,3,4, Youyang Yang1,2,3,4, Matthew Luchette1,2,3,4
1Division of Critical Care Medicine, Department of Anesthesiology, Critical Care and Pain Medicine, Boston Children's Hospital, Boston, MA.
概括
一个较小的,针对领域适应的语言模型 (LM),对儿科重症监护笔记进行了微调,在产生差异诊断方面表现优于较大的一般LM. 虽然这些专业的LM仍然低于临床医生,但它们显示出作为辅助工具的潜力.
科学领域:
- 人工智能在医学中的应用
- 临床决策支持系统 临床决策支持系统
背景情况:
- 生成性语言模型 (LMs) 越来越多地被评估用于医疗保健应用,但对儿科重症监护的研究有限.
- 评估LMS在儿科重症监护室 (PICU) 的临床任务中的实用性至关重要.
研究的目的:
- 在PICU设置中评估生成LM的有效性.
- 为了比较域适应LMM与较大,一般域LMM在从患者入院笔记生成差异诊断方面的性能.
主要方法:
- 以四级PICU (2012年1月至2023年4月) 的入院笔记为依据的回顾性队列研究.
- 开发和验证使用来自32,454名患者的超过190万张笔记.
- 评估由临床医生和五位重症监护专家使用5点利克特尺度生成的差异诊断和各种LM (一般和微调) 的评估.
主要成果:
- 性能最好的模型,一个微调的LLaMa-7B,获得了2.88的平均质量得分,相比之下,临床医生的得分为3.43.
- 精心调整的LLaMa-7B显著优于更大的一般LM,包括LLaMa-65B和BioGPT-Large.
- 在55%的病例中,临床医生诊断的质量排名最高,而微调的LLaMa-7B在29%的病例中排名最高.
结论:
- 一个针对特定域数据 (PICU注释) 微调的较小的语言模型可以超过更大的,通用域模型.
- 目前的LMM并不优于人类临床医生,但作为对现实世界临床任务的补充工具显示出希望.


