科学文本的自动注释用于基于ML的关键短语提取和验证
Oluwamayowa O Amusat1, Harshad Hegde2, Christopher J Mungall2
1Scientific Data Division, Lawrence Berkeley National Laboratory, 1 Cyclotron road, Berkeley, CA 94720, United States.
Database : the journal of biological databases and curation
|September 27, 2024
概括
自动化文本标签技术通过验证机器学习生成的元数据来加快科学创新. 新的方法利用链接数据和本体学,在环境基因组学中进行准确的元数据注释.
科学领域:
- 环境基因组学 环境基因组学
- 微生物组科学 微生物组科学
- 生物信息学是一种生物信息学.
背景情况:
- 先进的omics技术产生了庞大的数据集,缺乏有效搜索和利用的关键元数据.
- 手动的元数据策划和文本标签耗时,阻碍了科学进步.
- 环境基因组学和微生物组科学领域需要改进的元数据战略.
研究的目的:
- 开发和介绍新的自动化文本标签方法,用于验证机器学习生成的元数据.
- 在数据丰富的科学领域,迫切需要有效的元数据注释.
- 通过自动注释来提高科学数据集的可查和可用性.
主要方法:
- 开发了两种用于ML生成元数据验证的自动化文本标签技术.
- 技术1:利用不同数据源 (如出版物,提案) 之间的关系来进行同一项研究.
- 技术2:利用特定领域的受控词汇或本体学来生成标签.
主要成果:
- 拟议的标签分配方法为没有标签的科学文本生成了通用和高度特定的文本标签.
- 通过机器学习的关键词提取算法实现了高达44%的标签一致性.
- 证明了利用现有信息验证ML模型用于元数据提取的潜力.
结论:
- 自动化文本标签为omics研究中的元数据挑战提供了可行的解决方案.
- 提出的技术有效验证机器学习衍生元数据,提高数据的可发现性.
- 这些方法特别适用于环境基因组学,加速数据注释和科学创新.
更多相关视频
07:35A Knowledge Graph Approach to Elucidate the Role of Organellar Pathways in Disease via Biomedical Reports
Published on: October 13, 2023
1.6K
09:08From a Natural Product to Its Biosynthetic Gene Cluster: A Demonstration Using Polyketomycin from Streptomyces diastatochromogenes Tü6028
Published on: January 13, 2017
17.1K
