一个中国远程医疗对话数据集注释了被命名的实体
Shanshan Wang1, Yajing Yan2, Rong Yan3
1School of Economics and Management, Yan'an University, Yan'an, China.
BMC medical informatics and decision making
|November 17, 2023
概括
在远程医疗对话中注释医疗名称实体是具有挑战性的,因为非正式的语言. 这项研究开发了产科和妇科的数据集和模型,LatticeLSTM在命名实体识别 (NER) 中取得了最佳表现.
科学领域:
- 自然语言处理自然语言处理.
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
背景情况:
- 医疗命名实体的远程医疗对话注释对于人工智能开发至关重要.
- 患者对话中的非正式和长长的多字表达方式带来了注释挑战.
- 现有的数据集可能无法充分捕捉远程医疗通信的细微差别.
研究的目的:
- 解决在远程医疗对话中注释医疗名称实体的挑战.
- 创建一个全面的,对妇产科和妇产科远程医疗进行注释的数据集.
- 为这个领域的命名实体识别 (NER) 模型建立一个基准.
主要方法:
- 为六种实体类型 (疾病,症状,时间,药物,操作,检查) 制定了注释准则和两轮标记程序.
- 利用haodf.com的远程医疗对话数据集用于产科和妇科.
- 开发和评估了NER的四个深度学习模型,包括LatticeLSTM.
主要成果:
- 该数据集包括2,383次与63,560个被命名实体的咨询.
- LatticeLSTM在准确性,精度,回忆力和F分数方面表现出卓越的表现.
- 每个命名实体的平均字符数量为4.33.
结论:
- 该研究提供了一个复杂标记的数据集,用于医学命名实体的长长的多词表达式.
- 这项工作代表了在医疗数据集中标记时间实体的早期努力.
- 在六种标签类型中标注数据集的平衡性质预计将推动远程医疗AI.


