在乌尔都语中进行命名实体识别的深度学习方法
Rimsha Anam1, Muhammad Waqas Anwar1,2, Muhammad Hasan Jamal1
1Department of Computer Science, COMSATS University Islamabad, Lahore, Pakistan.
PloS one
|March 28, 2024
概括
这项研究引入了乌尔都语命名实体识别 (NER) 的新型深度学习方法,显著提高了准确性. 该方法使用FastText和Floret字嵌入,达到0.98.98的最高F分数.
科学领域:
- 自然语言处理 (Natural Language Processing) 是一种自然语言处理.
- 机器学习 机器学习
- 计算语言学 计算语言学
背景情况:
- 命名实体识别 (NER) 对于信息提取至关重要,但由于语言复杂性,乌尔都语仍未得到充分研究.
- 现有的乌尔都语NER模型通常依赖于词嵌入来提取特征,但成功程度各不相同.
研究的目的:
- 为乌尔都语命名实体识别 (NER) 提出一个强大的深度学习方法.
- 通过利用FastText和Floret词嵌入来增强功能提取,以获得上下文信息.
- 评估拟议的模型与基准乌尔都语数据集的最先进方法对比.
主要方法:
- 利用预训练的FastText和Floret字嵌入来生成四个乌尔都语数据集的特征向量.
- 训练了各种深度学习模型,包括长短期记忆 (LSTM),双向LSTM (BiLSTM) 和带有条件随机场 (CRF) 的门式循环单元 (GRU).
- 实现了BiLSTM+GRU与Floret嵌入的组合作为主要模型架构.
主要成果:
- 提出的深度学习方法显著优于现有的最先进的乌尔都语NER方法.
- 使用BiLSTM+GRU架构与Floret嵌入实现了0.98的最大F分数.
- 具有较低的分类错误率,在数据集中从1.24%到3.63%不等的稳定性.
结论:
- 将FastText和Floret嵌入式与先进的深度学习架构 (BiLSTM+GRU) 集成为乌尔都语NER提供了一个非常有效的解决方案.
- 拟议的方法代表了乌尔都语自然语言处理的重大进步,解决了语言形态学带来的挑战.
- 取得的成绩表明,这种方法在乌尔都文本分析和信息检索方面具有更广泛的应用潜力.
相关概念视频
RNA Editing
9.0K
RNA editing is a post-transcriptional modification where a precursor mRNA (pre-mRNA) nucleotide sequence is changed by base insertion, deletion, or modification. The extent of RNA editing varies from a few hundred bases, in mitochondrial DNA of trypanosomes, to a just single base, in nuclear genes of mammals. Even a single base change in the pre-mRNA can convert a codon for one amino acid into the codon for another amino acid or a stop codon. This type of re-coding can significantly affect the...
9.0K
lncRNA - Long Non-coding RNAs
2.8K
2.8K


