将非结构化心血管诊断报告自动转换为结构化数据集,使用顺序部署的大型语言模型
Sumukh Vasisht Shankar1, Lovedeep S Dhingra1, Arya Aminorroaya1
1Section of Cardiovascular Medicine, Department of Internal Medicine, Yale School of Medicine, New Haven, CT, USA.
medRxiv : the preprint server for health sciences
|October 17, 2024
概括
本研究介绍了HeartDx-LM,这是一种新的大型语言模型 (LLM) 系统,用于自动从非结构化心声回声图报告中提取有价值的数据. 这项创新通过使复杂的数据可访问,增强了心血管研究和患者护理.
科学领域:
- 心血管医学 心血管医学
- 人工智能的人工智能是人工智能.
- 医疗信息学医学信息学
背景情况:
- 心血管诊断测试产生了丰富的数据,这些数据通常被困在非结构化报告中.
- 手动数据抽象限制了实时患者护理和研究应用.
- 从心声回声图报告中自动提取数据对于临床实用性至关重要.
研究的目的:
- 开发和验证一种新的方法,从非结构化的TTE报告中自动提取数据.
- 利用大型语言模型 (LLM) 将自由文本临床叙述转化为结构化,可计算的数据.
- 改善心血管数据的可访问性,用于患者护理和研究.
主要方法:
- 使用生成性 (Llama2 70b) 和解释性 (Llama2 13b) LLM,采用了两步过程.
- 拉玛2 70b从现实数据中生成了各种TTE报告格式.
- Llama2 13b被微调以从自由文本叙述中提取18个关键的回声心脏学场,创建了HeartDx-LM模型.
主要成果:
- 心脏Dx-LM模型在从当代 (98.7%) 和较旧 (87.1%) 的心声回声图报告中提取数据时取得了高准确性.
- 对MIMIC-III (87.9%) 和MIMIC-IV (91.3%) 数据集的外部验证显示了强大的性能.
- 只有500份微调的注释报告可以实现稳定的表现.
结论:
- 使用配对LLM的新方法将非结构化心声回声学报告自动提取到表格数据集中.
- 这种可扩展的策略将非结构化报告转化为可计算的元素.
- 这种方法有望提高心血管保健的质量,并促进研究.


