AgCNER是第一个大型的中国命名实体识别数据集,用于农业疾病和害虫
Xiaochuang Yao1, Xia Hao2, Ruilin Liu2
1College of Land Science and Technology, China Agricultural University, Beijing, 100083, China.
Scientific data
|July 12, 2024
概括
一个新的大型中国数据集,AgCNER,和一个农业语言模型,AgBERT,被开发用于农业疾病和名为实体识别 (ADP-NER) 的害虫. 这些资源显著提高了ADP-NER的性能,帮助建立知识图表和问答系统.
科学领域:
- 农业科学 农业科学
- 自然语言处理自然语言处理.
- 计算语言学 计算语言学
背景情况:
- 命名实体识别 (NER) 对于农业知识图的构建和问题解答至关重要.
- 现有的中国农业疾病和害虫命名实体识别 (ADP-NER) 数据集很少,阻碍了研究和开发.
- 这种稀缺性限制了创建先进的农业信息系统.
研究的目的:
- 为了解决ADP-NER现有的中国数据集的局限性.
- 为中国的ADP-NER.开发一个大规模的,注释的语料库.
- 微调并发布农业语言模型以提高ADP-NER的性能.
主要方法:
- 一个大规模的中国语料库 (AgCNER) 的注释,有13个类别和超过20万个实体.
- 农业语言模型AgBERT的开发和微调.
- 在AgCNER数据集上使用BiLSTM-CRF和BERT模型进行实验评估.
主要成果:
- AgCNER是最大的公开可用的农业NER集体,包括13个类别,206,992个实体和66,553个样本.
- 在AgCNER上,BiLSTM-CRF模型获得了93.58%的F1得分.
- 使用AgBERT微调将F1得分提高到94.14%,证明了该模型的有效性.
结论:
- AgCNER集体和AgBERT模型代表了中国ADP-NER的重大进步.
- 这些资源验证了AgBERT的有效性和AgCNER数据集的质量.
- 公开可用的语料库和模型将促进农业NLP和知识图构建的进一步研究.


