生物VDB:用于高通量基因表达元分析的生物载体数据库
Michał J Winnicki1, Chase A Brown1,2, Hunter L Porter1
1Genes and Human Disease Research Program, Oklahoma Medical Research Foundation, Oklahoma City, OK, United States.
Frontiers in artificial intelligence
|March 25, 2024
概括
生物VDB是一个新的向量数据库,旨在用于基因表达数据分析. 它可以有效地查询和整合生物研究与人工智能和机器学习工具.
科学领域:
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
- 基因组学就是基因组学.
背景情况:
- 高通量测序产生了大量的基因表达数据,这些数据通常在NCBI的基因表达总汇 (GEO) 等存储库中公开提供.
- 分析和查询这个指数级增长的数据集,以寻找类似性和距离等模式,带来了重大挑战.
- 基因表达数据的向量化是人工智能 (AI) 和机器学习 (ML) 应用的常见先决条件.
研究的目的:
- 引入BioVDB,一个新的载体数据库,用于有效存储和分析基因表达数据.
- 加强生物研究与AI/ML工具的整合.
- 为了促进在大规模基因表达数据集中的模式发现和相似性分析.
主要方法:
- 开发和实施BioVDB,一个矢量数据库架构.
- 使用自动标签提取 (ALE) 来提取样本元数据标签 (年龄,性别,组织/细胞系).
- 从八个微阵列GEO平台摄入到BioVDB的438,562个样本.
主要成果:
- 生物VDB通过相似性搜索能够有效查询基因表达数据.
- 在识别和推断缺少样品标签时的证明实用性.
- 在大量样本中快速进行相似性分析.
结论:
- 生物VDB提供了一个可扩展的解决方案,用于管理和分析大型基因表达数据集.
- 该数据库增强了利用AI/ML技术在生物研究中的潜力.
- 生物VDB支持有效的数据探索,标签推断和相似性评估.


