通过检索增强多阶段培训进行弱监督的科学文档分类
概括
本研究介绍了WanDeR,这是一种新的科学文档分类方法,仅使用标签名称. WanDeR通过利用密集检索和标签扩展显著提高了分类准确性,克服了数据标签成本.
科学领域:
- 计算机科学 计算机科学
- 信息科学 信息科学 信息科学
- 人工智能的人工智能
背景情况:
- 科学文档分类是必不可少的,但由于人类标记数据的高成本而受到阻碍.
- 当标签名称包含文档库中缺少的域名特定术语时,现有方法会遇到困难.
研究的目的:
- 开发一种有效的科学文档分类方法,只使用标签名称.
- 为了应对与含义丰富但潜在稀疏的标签名称匹配文档的挑战.
主要方法:
- 提出了WanDeR,一种采用密集检索用于嵌入空间中的语义匹配的方法.
- 整合了标签名称扩展模块,以丰富标签表示.
- 利用自我训练步骤来完善分类预测.
主要成果:
- 与现有基线相比,WanDeR表现优越.
- 在三个实验数据集中,分类准确度提高了11.9%.
- 该方法有效地捕捉了标签语义,以改善文档匹配.
结论:
- WanDeR为科学文档分类提供了具有成本效益和准确的解决方案.
- 利用密集的检索和标签扩展可以提高模型理解标签语义的能力.
- 拟议的方法显示了科学信息管理中的实际应用的巨大潜力.


