从中国电子医疗记录中提取实体关系,基于特征增强和级联二进制标记框架
Xiaoqing Lu1, Jijun Tong2, Shudong Xia3
1School of Computer Science and Technology, Zhejiang Sci-Tech University, Hangzhou, China.
Mathematical biosciences and engineering : MBE
|February 2, 2024
概括
这项研究引入了一个新的神经网络,用于从长长的中国电子医疗记录中提取关系. 该模型实现了高精度和回忆,改善了从复杂文档中提取医疗信息.
科学领域:
- 自然语言处理自然语言处理.
- 医疗信息学 医疗信息学
- 机器学习 机器学习
背景情况:
- 从非结构化的中国电子医疗记录中提取实体关系对于提取医疗信息至关重要.
- 现有的模型在与中国电子医疗记录的文档级长度作斗争,导致性能问题.
- 显然需要先进的模型,能够在医疗环境中处理长文本序列.
研究的目的:
- 提出一个新的神经网络框架,从文档级别的中国电子医疗记录中提取实体关系.
- 解决现有模型在处理长长的医学文本序列方面的局限性.
- 开发一个模型,提高医学信息提取的准确性和效率.
主要方法:
- 一个神经网络模型,采用特征增强和级联二进制标记框架.
- 使用预先训练的模型进行文本标记化并获得词嵌入矢量.
- 功能增强网络将词向量与原始和位置特征融合在一起,然后是级联二进制标记解码器.
主要成果:
- 拟议的模型在新建的VSCMeD数据集上实现了87.82%的精度和88.47%的回忆.
- 对CMeIE-V2数据集的验证证明了该模型的有效性,精度为54.51%,回忆率为48.63%.
- 该模型成功地处理文档级的中国电子医疗记录,优于现有的方法.
结论:
- 功能增强和级联二进制标记神经网络框架对于在中国电子医疗记录中提取实体关系是有效的.
- 该模型在处理医疗文件特有的长文本序列方面取得了显著的改进.
- 开发的VSCMeD数据集为推进中国医疗信息提取研究提供了宝贵的资源.


