通过使用大型语言模型来扩展数据库和提取标记数据来推进植物代谢研究
Rachel Knapp1, Braidon Johnson1,2, Lucas Busta1
1Department of Chemistry and Biochemistry University of Minnesota Duluth Duluth Minnesota USA.
Applications in plant sciences
|August 6, 2025
概括
大型语言模型 (LLM) 通过从文献中提取数据来构建专门的数据库,在植物科学中显示出前景. 这项研究证明了LLM在识别酶-产品对,化合物-物种关联和转录表图像方面的准确性.
科学领域:
- 植物科学 植物科学
- 代谢学 代谢学 代谢学
- 生物信息学是一种生物信息学.
背景情况:
- 在植物科学中,可扩展的数据收集已取得显著的进步.
- 应用于大型数据集的机器学习为植物代谢研究提供了宝贵的见解.
- 大型语言模型 (LLM) 为巩固科学文献提供了一个新的前沿.
研究的目的:
- 评估LLM在从植物科学文献中提取结构化数据方面的有效性.
- 评估LLM在识别酶-产品对,化合物-物种关联和转录表格数据方面的表现.
- 探索LLMs在创建专业化,全面的植物科学数据库方面的潜力.
主要方法:
- 测试各种提示工程技术和语言模型,用于酶产品对的识别.
- 应用于复合物种协会的自动化提示工程和检索增强生成.
- 开发和验证一个多模式的LLM管道,用于将表格图像转录成机器可读的格式.
主要成果:
- 高精度 (80-90%) 实现了酶-产品对识别和表图像转录,当模型是任务调整时.
- 适度准确度 (50%) 对于表图像转录.
- 与以前的方法相比,在复合物种对鉴定中,虚假阴性率降低 (从55%降至40%).
结论:
- 在植物科学中,LLM显示了自动化数据提取和知识整合的巨大潜力.
- 针对特定任务的LLM调整对于实现高性能至关重要.
- 专业领域的专业知识对于在科学研究中有效利用LLMs至关重要.


