FuncFetch:一个LLM辅助的工作流使得从已发表的手稿中挖掘成千上万的酶基质相互作用
Nathaniel Smith1, Xinyu Yuan1, Chesney Melissinos1
1Plant Biology Section, School of Integrative Plant Science, Cornell University, Ithaca, NY 14853, United States.
Bioinformatics (Oxford, England)
|December 24, 2024
概括
一个新的工作流程FuncFetch使用人工智能快速从科学论文中提取酶活动,显著提高生物修复效率并发现未修复的酶功能.
科学领域:
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
- 分子生物学分子生物学
背景情况:
- 数以千计的公开可用的基因组含有功能不清楚的基因.
- 在实验特征蛋白活动和数据库条目之间存在差距,这主要是由于缓慢的生物保养过程.
研究的目的:
- 开发和验证一个自动化工作流程,FuncFetch,用于加速从科学文献中提取蛋白质和酶活动的文本挖掘.
- 利用大型语言模型来克服生物保养的瓶,并改善功能信息的沉积.
主要方法:
- FuncFetch集成了NCBI E-Utilities,OpenAI的GPT-4和Zotero,用于手稿选和数据提取.
- 工作流提取物种,酶名称,序列标识符,基质和产品.
- 进行了广泛的验证和质量分析,包括与手动策划的数据集进行比较.
主要成果:
- 在摘要中,GPT-4在识别特征性酶活动方面表现出高精度和回忆.
- FuncFetch成功地对9个植物酶家族的26543篇论文进行了选,从5459篇论文中获取了32605条条目.
- 分析显示,大约70%的实验性特征酶仍然未经理,发现的错误突出显示需要继续手动理.
结论:
- 通过自动化提取酶功能数据,FuncFetch显著推进了生物修复.
- 工作流有助于为酶家族创建全面的功能指纹.
- FuncFetch为预测未经表征的酶的功能和处理公共领域中庞大的未经处理的数据奠定了基础.


