列表:从eLabFTW中的注释实验文档中半自动提取元数据
Fathoni A Musyaffa1, Kirsten Rapp1, Holger Gohlke1,2
1Institute for Pharmaceutical and Medicinal Chemistry, Heinrich Heine University Düsseldorf, 40225 Düsseldorf, Germany.
Journal of chemical information and modeling
|September 29, 2023
概括
LISTER是一种自动从实验文档中提取元数据的新方法,使研究数据 FAIR (可查找,可访问,可互操作,可重复使用). 这简化了数据管理,提高了生命科学中的可复制性.
科学领域:
- 生命科学 生命科学
- 计算生物物理化学 计算生物物理化学
- 蛋白质生物化学 蛋白质生物化学
- 分子生物学分子生物学
背景情况:
- 科学中的可复制性依赖于可访问的方法,代码和数据.
- 公平的数据原则 (可查找,可访问,可互操作,可重复使用) 需要元数据注释.
- 目前的元数据创建对研究人员来说是劳动密集型的.
研究的目的:
- 开发一种自动化解决方案,从实验文档中提取元数据.
- 为了最大限度地减少研究人员在元数据生成中的努力,以实现 FAIR 数据合规性.
- 与现有的研究数据管理平台无集成.
主要方法:
- 开发了LISTER,这是一个用于元数据提取的方法和算法解决方案.
- 使用eLabFTW作为电子实验室笔记本,具有定制的条目和"容器"概念.
- 采用ISA (调查,研究,测试) 模型作为数据框架.
- 创建了一个基于Python的应用程序,用于半自动化元数据提取.
主要成果:
- LISTER有效地从注释,基于模板的文档中提取元数据.
- 以机器可读的 (.json) 和人类可读的 (.xlsx) 格式输出元数据.
- 为出版物生成 .docx 格式的材料和方法描述.
- 便于创建和扩展本体论,以增强数据价值.
结论:
- LISTER显著减少了创建和提取元数据所需的努力.
- 提高研究数据的公平性和可重复性.
- 适用于各种生命科学领域,可扩展到其他领域.
更多相关视频
08:22IR-TEx: An Open Source Data Integration Tool for Big Data Transcriptomics Designed for the Malaria Vector Anopheles gambiae
Published on: January 15, 2020
6.2K
05:35An Integrated Workflow of Identification and Quantification on FDR Control-Based Untargeted Metabolome
Published on: September 20, 2022
3.8K
