放射学高级采样技术 免费文本数据 通过深度学习在脊椎骨折中有效构建文本挖掘模型
Wei-Chieh Hung1,2,3, Yih-Lon Lin4, Chi-Wei Lin1,2
1Department of Family and Community Medicine, E-Da Hospital, I-Shou University, Kaohsiung 82445, Taiwan.
Diagnostics (Basel, Switzerland)
|January 22, 2024
概括
先进的采样方法,如向量和最小化,改善了深度学习模型,用于在放射学报告中识别脊椎压缩骨折 (VCF). 这种方法有效地选择关键数据,提高预测准确度.
科学领域:
- 医疗信息学 医疗信息学
- 自然语言处理自然语言处理.
- 机器学习 机器学习
背景情况:
- 在放射学报告中准确识别脊椎压缩骨折 (VCF) 对患者护理至关重要.
- 传统的文本挖掘方法可能难以应对自由文本临床数据的复杂性和数量.
- 深度学习模型为语义分析提供了潜力,但需要有效的数据采样策略.
研究的目的:
- 建立和评估先进的采样方法,以建立高效的语义文本挖掘模型.
- 用深度学习来比较不同采样技术在从放射学报告中识别VCF时的性能.
- 为自由文本分析中关键数据选择提出一个优化的抽样方法.
主要方法:
- 利用了来自脊柱X射线检查的27,401份自由文本放射学报告的数据集.
- 开发了监督的长期短期记忆 (LSTM) 网络,用于VCF识别.
- 我们比较了四种采样方法:向量和最小化,向量和最大化,分层和简单随机采样,采用固定百分比 (1/10,1/20,1/30,1/40).
- 使用接收器操作特征 (AUROC) 曲线下的面积来评估预测准确度.
主要成果:
- 矢量和最小化始终在所有采样比率中产生最高的AUROC值.
- 对于向量和最小化的AUROC值在不断下降的采样比率下从0.981到0.895不等.
- 矢量和最大化证明了最低的预测准确性.
- 拟议的矢量和最小化方法有效地识别了关键的代表性样本.
结论:
- 矢量和最小化是一种有效的先进抽样方法,用于构建语义文本挖掘模型的自由文本数据.
- 这种方法显著提高了深度学习模型的效率和预测准确性,例如LSTM,用于像VCF检测这样的临床应用.
- 这些发现表明,在医疗自然语言处理任务中优化数据选择的新方法.


