评估自动化数据集检索用于生物多样性监测的可行性
Alexandre Fuster-Calvo1, Sarah Valentin2, William C Tamayo1
1Biology Department, University of Sherbrooke, Sherbrooke, Quebec, Canada.
PeerJ
|February 3, 2025
概括
从Dryad和Zenodo等存储库中自动检索生物多样性数据对于有效的保护至关重要. 虽然有前途,但当前的自动化系统需要改进,特别是关于元数据质量,以充分支持生物多样性监测工作.
科学领域:
- 生物多样性信息学 生物多样性信息学
- 数据科学是数据科学.
- 保护生物学 保护生物学
背景情况:
- 有效的生物多样性保护和全球变化缓解取决于可访问,最新的生物多样性数据.
- 手动搜索,检索和集成数据是具有挑战性的,因为数据的大量和快速流入.
- 使用先进的算法自动化这些过程可以显著提高生物多样性监测.
研究的目的:
- 调查从存储库 (Dryad,Zenodo) 和科学文献 (Semantic Scholar) 获取和评估生物多样性数据的自动化潜力.
- 设计和应用数据集在生物多样性监测中的相关性评估系统,重点关注数据类型和时空范围.
- 评估监督分类模型以识别相关数据集并探索自动相关性排名.
主要方法:
- 使用应用程序编程接口 (API) 来从Dryad和Zenodo获取数据集.
- 开发了一个基于数据类型和时空覆盖标准的评估系统.
- 应用监督分类来检测数据集的相关性,并使用像F-score这样的指标评估性能.
- 手动评估数据集对加拿大北克国家生物多样性监测系统的相关性.
主要成果:
- 成功检索了89个 (55%) 的相关数据集,证明了自动存储库搜索的价值.
- 科学文献来源提供了更广泛的时间覆盖范围,并可以将用户引导到其他数据存储库.
- 自动分类系统获得了中等的F分数 (高达0.68),但显示出过度装配的迹象,表明需要改进.
- 确定了元数据的稀缺性和不均的分布,特别是空间和时间范围,作为一个关键的挑战.
结论:
- 从存储库中自动检索数据对于生物多样性监测非常有价值.
- 科学文献是时间覆盖和发现的补充数据来源.
- 需要进一步完善自动分类模型,解决元数据的局限性.
- 开发的评估框架和手动策划的数据可以作为未来自动化技术的基准.


