一个支持机器学习的科学文献的开放生物数据资源清单
Heidi J Imker1,2, Kenneth E Schackart1,3, Ana-Maria Istrate4
1Global Biodata Coalition, Strasbourg, France.
PloS one
|November 28, 2023
概括
使用机器学习和自然语言处理的新自动化方法从科学文献中确定了3112个生物数据资源,帮助全球生物数据联盟了解研究基础设施支持.
科学领域:
- 生物信息学是一种生物信息学.
- 数据科学数据科学数据科学
- 生命科学 生命科学
背景情况:
- 现代生物学研究在很大程度上依赖于生物数据资源,用于数据存档,策划和分析.
- 对生物数据资源的全球基础设施的持续融资是一个重大挑战.
- 全球生物数据联盟 (GBC) 旨在为这些必不可少的资源开发可持续的融资策略.
研究的目的:
- 开发一种自动化方法来创建一个全面的全球生物数据资源清单.
- 克服现有注册表的局限性,需要手动策划和自我注册.
- 以最小的人类干预来实现库存的定期更新.
主要方法:
- 利用机器学习支持的自然语言处理 (NLP) 在欧洲PMC的出版数据.
- 来自变压器的微调双向编码器表示 (BERT) 模型用于资源识别和名称预测.
- 包含用于低信心预测和重复解决方案的手册审查,并补充了资助者和地理位置数据的文章元数据.
主要成果:
- 从2011年至2021年间发表的文章中生成了3112个独特的生物数据资源的库存.
- 通过NLP方法,从出版物标题和摘要中成功识别了生物数据资源.
- 开发了可复制库存生成的自动化管道,所有代码和数据都在允许许可证下发布.
结论:
- 基于NLP的自动化方法提供了一种高效且可扩展的方法来对生物数据资源进行编目.
- 该清单有助于全球生物数据联盟评估全球生物数据基础设施的范围和支持.
- 代码和数据的公开发布促进了重复使用,并支持生物研究的重要生物数据资源的可持续性.
更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
232
09:37Navigating MARRVEL, a Web-Based Tool that Integrates Human Genomics and Model Organism Genetics Information
Published on: August 15, 2019
9.8K
