生物工作流:从出版物中获取全面的生物信息学工作流.
Yidan Wang1,2, Jiayin Wang1,2,3
1School of Computer Science and Technology, Faculty of Electronics and Information Engineering, Xi'an Jiaotong University, No. 28 Xianning West Road, Beilin District, Xi'an, Shaanxi 710049, China.
Briefings in bioinformatics
|November 8, 2025
概括
生物工作流 (BioWorkflow) 是一种使用大型语言模型 (LLM) 的新框架,自动化了从科学论文中对生物信息学工作流的重建. 这提高了可复制性和准确性,大大减少了手动固时间.
科学领域:
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
- 科学文献 矿业 矿业
背景情况:
- 从出版物中重建生物信息学工作流程对于科学分析至关重要,但由于信息在各种文档格式中分散而受到阻碍.
- 手动重建是耗时且容易出现错误的,而现有系统缺乏全文,多模式功能,无法完全提取工作流程.
研究的目的:
- 引入BioWorkflow,一种基于大型语言模型 (LLM) 的新框架,旨在自动化,从科学文献中对生物信息学工作流程进行端到端的重建.
- 提高生物信息学管道提取和再利用的准确性,完整性和可重复性.
主要方法:
- 生物工作流采用了一个提取增强框架,它解析PDF文件以创建文本,表和图形的统一索引.
- 它使用层次查询分解与动态重构和代,上下文意识的检索来组装指导工作流.
- 该框架将预测的元素与引用的证据联系起来,并执行自动一致性检查,以确保可追溯性并最大限度地减少幻觉.
主要成果:
- 生物工作流恢复了大约80%的工作流程步骤,比现有工具 (~20%) 显著改进.
- 与强大的LLM基线相比,它在可复制性,完整性和准确性方面得到了>20%的改进.
- 策划时间减少到每张纸的3-5分钟,使已发布的管道能够更快地重复使用.
结论:
- 生物工作流有效地自动地从科学出版物中提取详细的生物信息学工作流.
- 该框架提高了重复使用已发布的计算管道的可靠性和效率,促进了科学可重复性.


