利用LLM在中国医疗检查报告中的有效数据结构标准化
概括
大型语言模型 (LLM) 可以通过准确预测部门和项目名称来标准化中国医疗报告. 这一进步改善了医院间的健康数据一致性和自动化分析.
科学领域:
- 人工智能的人工智能
- 医疗信息学 医疗信息学
- 自然语言处理自然语言处理.
背景情况:
- 中国的医学检查报告缺乏标准化的术语,阻碍了健康评估和数据分析.
- 医院之间报告的差异为统一的数据解释带来了重大挑战.
研究的目的:
- 评估大型语言模型 (LLM) 在标准化中文医学检查报告中的有效性.
- 评估快速工程和LoRA微调,以提高医学文本数据的LLM性能.
主要方法:
- 利用了超过90万份中国医疗报告的大数据集.
- 在各种LLM上使用快速工程和LoRA微调技术,包括Qwen2.5-14B.
- 进行了交叉验证实验,以评估在未见的医院数据上的模型概括.
主要成果:
- 精心调整的LLMs,特别是Qwen2.5-14B,在标准化部门和项目详细名称方面取得了很高的准确性.
- 在医疗报告标准化方面,LLM显著优于BERT等传统方法.
- 在未见的医院数据上达到98.34%的平均准确性,显示出强大的概括能力.
结论:
- 在中国,LLM显示出标准化医疗检查报告的巨大潜力.
- 这项研究为大规模医疗数据的自动处理和分析提供了基础.
- 精心调整的LLM提供了一个强大的解决方案,以应对非标准化医学术语的挑战.


