DE-Lemma:一个基于最大的Lemmatizer,用于德国医学文本
1Dept. of Medical Informatics, Heilbronn University, Heilbronn, Germany.
Studies in health technology and informatics
|September 12, 2023
概括
这项研究开发了一种机器学习方法,用于德国医学文本的 lemmatization. 最好的模型实现了88.0%的准确性,改善了生物医学文件的处理.
科学领域:
- 计算语言学计算语言学
- 自然语言处理 (NLP) 是一种自然语言处理.
- 生物医学信息学 生物医学信息学
背景情况:
- 处理德语文本,特别是在生物医学领域,需要精确的词的 lemmatization.
- 具有拉丁语和希腊语根源的医学语言对标准的 lemmatization 和 stemming 技术提出了挑战.
- 现有的方法可能会产生不准确的结果,对于德国的专业医疗文本,如出院信和电子健康记录 (EHR).
研究的目的:
- 为德国生物医学文本开发和评估基于机器学习的 lemmatization 方法.
- 使用公开可用的德国树木库训练Apache OpenNLP lemmatizer模型.
- 评估这些模型在真实世界医学数据上的表现.
主要方法:
- 使用Apache OpenNLP来训练 lemmatizer 模型.
- 使用公开的德国树木库进行模型培训.
- 评估了四个"DE-Lemma"模型与从出院信中获取的生物医学名词的数据集.
主要成果:
- 开发的"DE-Lemma"模型在生物医学名词的样本上进行了测试.
- 最有效的DE-Lemma模型显示了高精度的88.0%.
- 最好的模型获得了F1得分0.936,表明了强大的性能.
结论:
- 机器学习为德国生物医学文本 lemmatization 提供了一个可行的解决方案.
- 经过训练的DE-Lemma模型在改善医学领域的NLP任务方面显示出显著的前景.
- 精确的 lemmatization 对于电子医疗和健康记录 (EMR,EHR) 的有效处理至关重要.


