xMEN:用于跨语言医疗实体规范化的模块化工具包
Florian Borchert1, Ignacio Llorca1, Roland Roller2
1Hasso Plattner Institute for Digital Engineering, University of Potsdam, Potsdam 14482, Germany.
JAMIA open
|December 30, 2024
概括
xMEN系统增强了跨语言的医疗实体规范化,特别是在低资源语言中. 它通过利用多语言别名和新的培训技术来提高绩效,实现了最先进的结果.
科学领域:
- 自然语言处理自然语言处理.
- 计算语言学 计算语言学
- 生物信息学是一种生物信息学.
背景情况:
- 医疗实体规范化对于医疗保健中的信息提取至关重要.
- 现有系统经常因有限的术语和注释而与低资源语言扎.
- 提高跨语言能力对于全球健康信息学至关重要.
研究的目的:
- 开发一个强大的跨语言医疗实体规范化 (MEN) 系统,在高资源和低资源的场景中表现良好.
- 通过利用多语言信息来解决语言特定资源的稀缺问题.
- 引入新的培训方法,并在跨语言背景下重新排名医疗实体.
主要方法:
- 提出了xMEN,一个模块化系统,用于跨语言的MEN.
- 雇佣了使用多语言别名的跨语言候选人.
- 整合了一个可训练的交叉编码器 (CE) 用于候选人排名,具有新的排名规范化术语.
- 开发了弱标记的数据集,用于在低资源场景中使用机器翻译和注释投影进行重新排名.
主要成果:
- xMEN 在几个欧洲语言的基准数据集上实现了最先进的性能.
- 在缺乏目标任务培训数据的场景中,证明了监督较弱的CE的有效性.
- 识别了复杂的实体,作为正常化的一个剩余挑战.
结论:
- xMEN 提供了强大的性能,用于跨多种语言的医疗实体规范化,即使具有有限的标记数据和术语.
- 该系统的模块化设计允许轻松集成新的模块和数据集.
- 发布了一个开源的Python工具包,以促进可重现的研究和未来的基准.


