促进基因组学分析的GPT模型:通过RAG和微调生成可靠的遗传变异注释和解释
1Department of Genetics, Yale University School of Medicine, New Haven, CT 06511, United States.
Bioinformatics advances
|February 21, 2025
概括
大型语言模型 (LLM) 用取回增强生成 (RAG) 和微调来增强基因组学. RAG显著提高了变体注释的准确性和可访问性,超过了对事实知识注入的微调.
科学领域:
- 基因组学就是基因组学.
- 人工智能的人工智能
- 生物信息学是一种生物信息学.
背景情况:
- 大型语言模型 (LLM) 具有广泛的知识,但缺乏专业领域的专业知识,例如基因组学.
- 变异注释数据对于解释遗传变异和从大规模测序中优先考虑与疾病相关的发现至关重要.
- 目前的LLM需要改进,以有效处理和解释复杂的基因组数据.
研究的目的:
- 为了提高在基因组学领域的LLMs的表现.
- 将变量注释数据集成到LLM中,使用检索增强生成 (RAG) 和微调技术.
- 提高基因变异的解释和优先级.
主要方法:
- 实现了检索增强生成 (RAG),将1.9亿个变体注释集成到GPT-4o.
- 在GPT-4上使用了微调技术,并使用了变体注释数据.
- 我们比较了RAG的有效性和对知识注入的微调.
主要成果:
- RAG成功地集成了大量准确的变体注释,使用户能够查询特定的变体以进行解释.
- 微调在一些注释字段中提高了性能,但与RAG相比,整体准确性仍然不足于最佳水平.
- 在事实知识整合的数据量,准确性和成本效益方面,RAG在微调方面表现优越.
结论:
- 该研究通过RAG和微调成功增强了基因组学LLM能力.
- 在LLMs中注入事实基因组知识时,RAG是一种比微调更有效的方法.
- 这项开创性的工作为临床诊断和研究的基因组学中先进的AI系统铺平了道路.
更多相关视频
09:34Targeted Next-generation Sequencing and Bioinformatics Pipeline to Evaluate Genetic Determinants of Constitutional Disease
Published on: April 4, 2018
33.4K
11:35Screening for Functional Non-coding Genetic Variants Using Electrophoretic Mobility Shift Assay EMSA and DNA-affinity Precipitation Assay DAPA
Published on: August 21, 2016
12.9K
