开源和可复制和廉价的基础设施,用于数据挑战和教育
Peter E DeWitt1, Margaret A Rebull2, Tellen D Bennett3,4,5
1Department of Biomedical Informatics, University of Colorado School of Medicine, University of Colorado, Aurora, CO, USA. peter.dewitt@cuanschutz.edu.
研究人员开发了一种廉价,轻量级的工作流程,用于数据共享和托管研究数据挑战. 这种方法利用公共存储库和开源工具,使更多科学家能够获得先进的数据分析.
科学领域:
- 生物医学研究的研究.
- 数据科学是数据科学.
- 计算生物学是一种计算生物学.
背景情况:
- 数据共享对于最大化研究知识和实现二次分析至关重要.
- 当前的生物医学数据挑战往往需要昂贵的云计算和行业合作伙伴关系,从而造成财务障碍.
- 需要具有成本效益和计算可访问的方法来进行数据共享和托管数据挑战.
研究的目的:
- 为可重复模型培训,测试和评估开发一种廉价和计算轻量级的工作流.
- 通过进行数据挑战来证明这个工作流的实用性.
- 为寻求数据共享和数据挑战的可访问基础设施的研究人员提供资源.
主要方法:
- 利用公共 GitHub 存储库进行代码共享和版本控制.
- 利用开源计算语言用于模型开发和分析.
- 采用Docker技术进行集装箱化,确保可复制性和可移植性.
- 开发了一种可复制模型培训,测试和评估的工作流程.
主要成果:
- 成功开发并实施了一种具有成本效益的基础设施,用于托管数据挑战.
- 工作流允许可重复的模型培训,测试和评估.
- 开发的基础设施和工作流程在进行的数据挑战中被证明是有效的.
结论:
- 开发的工作流和基础设施为昂贵的基于云的解决方案提供了可访问的替代方案.
- 这种方法促进了数据共享和生物医学研究数据挑战的托管.
- 该方法可能对数据挑战和科学教育目的都很有价值.
更多相关视频
09:43Databases to Efficiently Manage Medium Sized, Low Velocity, Multidimensional Data in Tissue Engineering
Published on: November 22, 2019
08:29An Open Source Technology Platform to Manufacture Hydrogel-Based 3D Culture Models in an Automated and Standardized Fashion
Published on: March 31, 2022
相关概念视频
GIS Software, Hardware, and Sources of GIS Data
Distribution Reliability and Automation
Introduction to R
Data Reporting and Recording
Data Collection by Experiments
An example of the experimental method is a public...
Archival Research
