在不平衡的数据集中,使用基于注意力的Bi-LSTM和混合平衡技术来改善临床缩写意义的歧义
Manda Hosseini1, Amir Hossein Rasekh1, Amin Keshavarzi2
1Department of Computer Engineering, Zand Institute of Higher Education, Shiraz, Iran.
Journal of evaluation in clinical practice
|July 20, 2024
概括
本研究介绍了一种基于注意力的双向长期短期记忆 (Bi-LSTM) 模型,用于临床缩写的明确化. 该模型通过使用数据生成技术来提高不平衡数据集的准确性,达到96.09%的准确性.
科学领域:
- 自然语言处理自然语言处理.
- 医疗保健中的机器学习
- 临床信息学 临床信息学
背景情况:
- 临床缩写给决策支持系统带来了模两可的挑战.
- 临床数据集中的类不平衡会降低分类器的准确性,增加错误率.
- 传统模型和神经网络与不平衡的临床数据作斗争.
研究的目的:
- 开发基于注意力的双向长期短期记忆 (Bi-LSTM) 模型,用于临床缩写的明确化.
- 使用数据生成技术解决有限的培训数据和类不平衡问题.
- 为了提高临床文档分析的准确性.
主要方法:
- 使用了Bi-LSTM分类模型,并配备了注意力机制,用于缩写清晰化.
- 采用数据生成技术,包括反向替换和同义词替换,以平衡数据集.
- 根据每个缩写的准确性评估模型性能.
主要成果:
- 数据平衡技术提高了2.08%的模型精度.
- 基于注意力的Bi-LSTM模型在UMN数据集上实现了96.09%的准确性.
- 超越现有的最先进的技术结果在临床缩写的明确性.
结论:
- 像Bi-LSTM这样的深度神经网络对于临床缩写有效.
- 数据生成技术减轻了有限和不平衡的临床数据集带来的挑战.
- 拟议的方法显著提高了临床缩写的准确性.


