基于即时的生物信息管道生成,用于多步骤的metaviral工作流.
Pengchong Ma1, Haoze Zheng1, Weijun Yi2,3
1School of Computing, University of Nebraska Lincoln, Lincoln, NE 68588, United States.
Bioinformatics advances
|January 12, 2026
概括
大型语言模型 (LLM) 可以生成复杂的生物信息管道,帮助研究人员没有广泛的编程技能. 像ChatGPT-4和Gemini 2.5这样的高级模型在创建和更新这些自动化工作流程方面表现出卓越的性能.
科学领域:
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
- 人工智能的人工智能
背景情况:
- 生物信息学工具和多步分析程序的日益复杂性挑战了有效的计算管道的创建.
- 研究人员,特别是那些编程专业知识有限的研究人员,在开发和维护这些工作流程方面面临重大障碍.
研究的目的:
- 研究大语言模型 (LLM) 在生成端到端生物信息学管道方面的潜力.
- 评估各种LLM在创建自动化分析工作流程中的有效性,以多步骤的metaviral工作流作为案例研究.
主要方法:
- 测试多个大型语言模型,包括OpenAI的ChatGPT系列,Anthropic的Claude系列,谷歌双子座,Meta Llama和DeepSeek.
- 使用精心设计的提示,并结合官方文档来指导LLM的执行.
- 评估管道生产成功率和模型处理工具替代的能力.
主要成果:
- 在生成完整的生物信息管道方面,ChatGPT-4,ChatGPT-5,Claude 4.5和Gemini 2.5在统计学上表现出显著的优异性能.
- 这些领先的LLM有效地管理了工具替代,并受益于快速的工程和文档集成.
- 所有经过测试的LLM都显示出初始管道生成和随后更新的潜力.
结论:
- 在生物信息学管道建设的自动化,复杂分析的民主化方面,LLM提供了一个有前途的解决方案.
- 快速工程和利用工具文档是最大限度地提高生物信息学管道产生的LLM有效性的关键策略.
- 该研究为使用人工智能来简化生物信息学工作流程开发和维护提供了基础.


