用于技术语言处理的关键短语提取
1National Institute of Standards and Technology, Gaithersburg, MD 20899, USA.
概括
一个用于技术语言处理 (TLP) 关键词提取的新工具包显示了与既定方法相比的竞争性表现,特别是在低资源场景中. 这种方法为专门的科学领域的元数据生成提供了可行的替代方案.
科学领域:
- 自然语言处理自然语言处理.
- 信息检索 信息检索
- 计算语言学 计算语言学
背景情况:
- 关键短语提取对于技术语言处理 (TLP) 中的元数据生成至关重要.
- 标准自然语言处理 (NLP) 方法需要针对TLP进行调整,因为TLP具有特殊的特性.
- 低资源的TLP应用程序需要高效和有效的关键词提取工具.
研究的目的:
- 评估一种用于TLP关键词提取在低资源环境中的新型工具包.
- 为了比较基于工具包的方法使用分布式特征与毛伊自动主题索引器的性能.
- 评估TLP关键词提取在技术文献集合上的有效性.
主要方法:
- 开发了一个工具包,将文本特征和分类器结合起来,用于TLP关键词提取.
- 在工具包中使用单词和短语的分布特征.
- 将工具包方法与毛伊自动主题索引器进行了比较.
- 评估了两个技术文献数据集的性能:化学热力学杂志 (JCT) 和SemEval任务5.
主要成果:
- 工具包方法显示了与毛伊的竞争性表现,特别是当作者提供的关键词被排除在外时.
- 对于TRC-JCT文章,毛伊达达到了29.4%的F测量,而工具包达到了28.2%.
- 对于SemEval文章,该工具包 (使用Naïve Bayes) 实现了20.8%的F测量,超过了毛伊的18.8%.
结论:
- 拟议的工具包是TLP关键词提取的可行和有竞争力的方法,特别是在资源不足的环境中.
- 分布特征与分类器相结合,为技术元数据生成提供了有效的策略.
- 这些发现支持开发TLP的专用工具,以加强信息检索和注释.
相关概念视频
Pre-mRNA Processing: RNA Splicing
5.2K
5.2K
Protein Kinases and Phosphatases
3.8K
3.8K
The Nucleolus
3.8K
3.8K
Gene Families
2.5K
2.5K
Multi-pass Transmembrane Proteins and β-barrels
5.2K
In multi-pass transmembrane proteins, the polypeptide chain crosses the membrane more than once. The transmembrane polypeptide chain either forms an α-helix or β-strand structure. α-Helix containing multi-pass transmembrane proteins are ubiquitous, whereas β-strand containing ones are mainly found in gram-negative bacteria, mitochondria, and chloroplasts.
α-Helix containing multi-pass transmembrane proteins
Multi-pass transmembrane proteins such as...
α-Helix containing multi-pass transmembrane proteins
Multi-pass transmembrane proteins such as...
5.2K
Mechanical Protein Function
2.0K
2.0K


