将非结构化心血管诊断报告自动转换为结构化数据集,使用顺序部署的大型语言模型
Sumukh Vasisht Shankar1, Lovedeep S Dhingra1, Arya Aminorroaya1
1Section of Cardiovascular Medicine, Department of Internal Medicine, Yale School of Medicine, 195 Church Street, 6th Floor, New Haven, CT 06510, USA.
European heart journal. Digital health
|July 24, 2025
概括
大型语言模型 (LLM) 现在可以从非结构化的心声回声图报告中提取有价值的心血管数据,改善临床见解和研究的数据可访问性.
科学领域:
- 心血管诊断心血管诊断
- 医学中的人工智能
- 自然语言处理自然语言处理.
背景情况:
- 心血管诊断测试产生了丰富的数据,这些数据通常被困在非结构化报告中.
- 这些数据的有限可访问性阻碍了其临床实用性和研究潜力.
研究的目的:
- 开发和验证一种使用大型语言模型 (LLM) 的新方法,以将自由文本回声心脏学报告转化为结构化,表格式数据集.
- 改善心血管数据的可访问性和可用性.
主要方法:
- 顺序部署生成式和解释式开源LLM (Llama2-70b,Llama2-13b).这是一个很好的方法.
- 精细调整的Llama2-13b (HeartDX-LM) 使用生成的胸前心电图 (TTE) 报告来提取18个心电图领域的数据.
- 在各种数据集上评估了HeartDX-LM,包括耶鲁纽黑文卫生系统 (YNHHS),MIMIC-III和MIMIC-IV.
主要成果:
- 在数据提取中,HeartDX-LM实现了高精度:在YNHHS中达到98.7%,在较旧的YNHHS报告中达到87.1%,在MIMIC-III中达到87.9%,在MIMIC-IV中达到91.3%.
- 识别了至少500个非结构化报告-结构化数据对,以便进行有效的微调.
- 已经公开发布了HeartDX-LM模型.
结论:
- 使用配对LLM的新方法有效地将自由文本回声心脏病学报告转化为有价值的表格数据集.
- 这种方法显著提高了心血管数据的可访问性和实用性,用于临床应用和研究.


