使用大型语言模型提取生物术语可以提高生物样本数据库中元数据的可用性
Shuya Ikeda1,2, Zhaonan Zou3, Hidemasa Bono1,2,4
1Database Center for Life Science, Joint Support-Center for Data Science Research, Research Organization of Information and Systems, Univ. of Tokyo Kashiwanoha-campus Station Satellite 6F. 178-4-4 Wakashiba, Kashiwa-shi, Chiba 277-0871, JAPAN.
大型语言模型 (LLM) 通过准确地从生物样本描述中提取元数据来提高实验数据的可查性. 这种自动化增强了数据的可重复使用性和科学数据管理,减少了人工策划工作.
科学领域:
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
- 数据科学数据科学数据科学
背景情况:
- 生物样本是实验样本元数据的大型存储库,对于数据可搜索性至关重要.
- 元数据的变化和缺乏标准化最佳实践,阻碍了数据的可查和可重复使用.
- 手动策划数百万条记录是不切实际的;现有的自动化方法有局限性.
研究的目的:
- 评估大型语言模型 (LLM) 在自动化元数据策划中的有效性.
- 评估LLM在提取特定实验细节的表现,如细胞系名和操纵的基因.
- 提高存档实验数据的可查和可重复使用性.
主要方法:
- 利用来自ChIP-Atlas的黄金标准数据集来评估LLM在提取细胞系名的性能.
- 采用LLM辅助方法,从未处理的元数据中提取实验性操纵基因的信息.
- 与传统元数据策划方法相比,LLM的性能进行了比较.
主要成果:
- 与传统方法相比,LLM辅助的方法在提取细胞系名称方面表现出更高的准确性和覆盖范围.
- 从没有手动策划的元数据中成功提取实验性操纵的基因信息.
- 实现了更精确的数据过,并防止了误解.
结论:
- 在像BioSample这样的大型生物数据库中,LLM显示了自动化元数据策划的巨大潜力.
- 通过LLM的应用,可以大大提高实验数据的可查性和可重复使用性.
- 自动化减少了用户的工作量,并促进了更有效的科学数据管理.
更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
07:11Author Spotlight: Emerging Technologies and Advanced Tools for Decoding Metabolomics Data Analysis
Published on: November 10, 2023
相关概念视频
Applications of Molecular Taxonomy
Modern Molecular Taxonomy
Genomics
