加快医疗记录数据抽象和分析肌肉发育不良:大型语言模型和疾病国际分类代码
Huixue Zhou1,2, Geetanjali Rajamani3, Jiatan Huang2
1Institute for Health Informatics, University of Minnesota, Minneapolis.
Neurology. Clinical practice
|September 25, 2025
概括
大型语言模型 (LLM) 显示出加速电子病历 (EMR) 抽象在肌肉发育不良研究的希望,尽管目前的性能落后于手工方法. 国际疾病分类 (ICD) 代码数可能有助于识别高产率病例.
科学领域:
- 医疗信息学 医疗信息学
- 遗传学 是一个遗传学.
- 神经学 神经学
背景情况:
- 肌肉发育不良是一种渐进的肌肉疾病,需要有效地从电子病历 (EMR) 中抽取数据,用于研究和监测.
- 手动EMR抽象是耗时和劳动密集的,需要探索自动化方法.
- 大型语言模型 (LLM) 和国际疾病分类 (ICD) 代码元分析被调查为潜在的解决方案.
研究的目的:
- 评估LLM和ICD代码元分析在加速EMR数据抽象中对肌肉衰竭病例的有效性.
- 为了比较LLMs与手册注释对肌肉发育不良的关键临床特征的性能.
- 评估ICD代码在预测杜申肌肉发育不良症 (DMD) 和四肢腰带肌肉发育不良症 (LGMD) 的诊断确定性方面的有用性.
主要方法:
- 一项涉及44名患者 (22名DMD,22名LGMD) 手动注释症状,门诊状态,CK水平和遗传结果的EMR的横截面研究.
- 在这些病例的临床笔记上测试了五个LLM,通过F1得分与手册注释来衡量性能.
- 分析了77名DMD和59名LGMD患者的单独队列,以将ICD代码遭遇数与诊断确定性相关联.
主要成果:
- 手动注释实现了高度的互评分协议 (80-100%).
- 表现最好的LLM,Llama 3-8b,在不同特征中显示了可变的精度 (46.8%-69.2%),通常低于手动抽象.
- 较多的ICD代码遭遇 (DMD≥20,LGMD≥25) 与确定的或可能的诊断相关.
结论:
- 在肌肉发育不良等罕见疾病中,LLM具有加速EMR抽象的潜力,但目前无法与非结构化数据的手动抽象精度相匹配.
- 拉玛3-8b在测试的LLMs中表现最高.
- ICD代码元数据,特别是遭遇计数,可以成为监视和研究工作中优先考虑案件的有价值工具.


