相关实验视频
Updated: Jul 25, 2025

13:19
Deep Neural Networks for Image-Based Dietary Assessment
Published on: March 13, 2021
9.2K
EduNER:一个中国命名实体识别数据集用于教育研究
Xu Li1, Chengkun Wei1, Zhuoren Jiang2
1College of Computer Science and Technology, Zhejiang University, 38 Zheda Rd., Hangzhou, 310027 Zhejiang China.
Neural computing & applications
|June 26, 2023
概括
研究人员开发了EduNER,这是一个新的中国数据集,用于教育中的命名实体识别 (NER). 本资源旨在通过提供多样化,专家注释的数据来推进特定领域的NER模型.
科学领域:
- 自然语言处理自然语言处理.
- 提取信息 提取信息
- 教育技术的教育技术
背景情况:
- 域特定的命名实体识别 (NER) 需要高质量,有针对性的数据集.
- 现有的数据集往往没有涵盖教育领域内的专业术语和背景.
- 以教育为导向的NER模型的发展受到缺乏全面的,公开可用的数据集的阻碍.
研究的目的:
- 推出EduNER,一个专门为教育部门的新,高质量,面向领域的中国命名实体识别数据集.
- 促进针对教育背景的先进中国NER模型的开发和评估.
- 提供一个基准数据集,用于未来的教育特定的NLP任务研究.
主要方法:
- 从各种来源收集数据,包括教科书,学术论文和教育相关的网页,涵盖2012-2021年.
- 对16种特定于教育的实体类型的专家驱动的模式定义.
- 由经过培训的注释者使用协作标签平台进行注释,结果是11k+句子和35,731个注释实体.
主要成果:
- EduNER数据集包括16种不同的实体类型,11,000多个句子和35,731个注释实体.
- 统计分析和比较揭示了EduNER相对于开放域和其他特定域的NER数据集的独特特征.
- 在EduNER上对16个最先进的模型的评估证明了其对任务验证的实用性,并突出了模型改进的潜力.
结论:
- EduNER被介绍为教育领域中中国NER的第一个公开可用的数据集.
- 预计数据集的质量,多样性和专家注释将大大促进以教育为导向的NER模型的开发.
- 该资源为在教育技术领域推进NLP应用提供了宝贵的基础.

