BioBERTurk:在低资源环境中探索土耳其生物医学语言模型开发策略
Hazal Türkmen1, Oğuz Dikenelli1, Cenk Eraslan2
1Department of Computer Engineering, Ege University, 35100 İzmir, Turkey.
Journal of healthcare informatics research
|November 6, 2023
概括
本研究介绍了BioBERTurk,这是土耳其生物医学自然语言处理 (NLP) 的预训练语言模型. 最好的模型,进一步在生物医学体内进行预训练,在分类放射学报告方面显著超过其他模型.
科学领域:
- 生物医学自然语言处理 (NLP)
- 低资源语言NLP是NLP.
背景情况:
- 预先训练有素的语言模型在英语生物医学NLP中表现出色.
- 对低资源语言的研究有限,因此对于这些环境需要有效的模型.
研究的目的:
- 介绍BioBERTurk家族的四个预训练模型,用于土耳其生物医学.
- 在分类土耳其头部CT放射学报告上评估模型性能.
主要方法:
- 开发了四个BioBERTurk模型,包括对生物医学体和放射学论文进行预训练的变体.
- 与土耳其语BERT (BERTurk),多语言BERT (mBERT) 和LSTM+注意力基线进行比较.
- 对放射学报告的"印象"和"发现"部分进行分类的评估模型.
主要成果:
- 在一般生物医学体上进行预训练的模型显著超过了BERTurk,mBERT和基线.
- 一个仅使用放射学论文进行持续预训练的模型在"印象"数据集上略有改善.
- 将放射学和生物医学机构与BERTurk的机构结合起来,并从零开始进行预训练,导致表现最差.
结论:
- 在土耳其生物医学NLP中,使用生物医学语料库进行BERTurk的持续预训练是有效的.
- 任务特定的数据,如放射学论文,可以提高特定子域的模型性能.
- 模型架构和体组成在低资源的生物医学NLP中显著影响性能.


