自动PM3:通过LLM驱动的PM3从科学文献中提取证据来增强变体解释
Shumin Li1,2,3, Yiding Wang1, Chi-Man Liu1
1Department of Computer Science, School of Computing and Data Science, University of Hong Kong, Hong Kong, 999077, China.
Bioinformatics (Oxford, England)
|June 30, 2025
概括
自动PM3自动从科学文献中提取关键的遗传变异证据,显著加快罕见疾病诊断. 该方法使用开源的大型语言模型进行高效和成本效益的分析.
科学领域:
- 基因组学就是基因组学.
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
背景情况:
- 罕见疾病影响全球超过3亿人,经常源于遗传变异.
- 解释遗传变异,特别是收集基于文献的证据 (例如,ACMG/AMP PM3),是罕见疾病诊断中的一个重大瓶.
- 目前的证据提取方法往往复杂且耗时.
研究的目的:
- 开发一种自动化方法,从科学文献中提取ACMG/AMP PM3证据.
- 利用开源的大型语言模型 (LLM) 实现高效和成本效益的变体解释.
- 为了加速罕见疾病的诊断过程.
主要方法:
- 介绍了AutoPM3,一种新的方法,使用开源的LLM来自动提取PM3证据.
- 集成基于Text2SQL的变体提取器和检索增强生成 (RAG) 模块.
- 增强RAG模块的变体特定的检索器和微调的LLM,用于单独处理表和文本.
- 创建了PM3-Bench,这是来自ClinGen.的1027个变异出版证据对的精心策划的数据集.
主要成果:
- 在公开可访问的数据上,AutoPM3在变体匹配方面实现了86.1%的准确性,在跨变体中实现了72.5%的回忆.
- 该方法的性能优于现有的方法,包括使用较大的模型的方法.
- 一项序列性废除研究证实了AutoPM3核心组件的有效性,特别是变种特定的检索器和Text2SQL.
- 证据的定位在短短76秒内实现,显示出显著的效率提升.
结论:
- 开源的LLM为自动化基因变异证据提取提供了高效和成本效益的解决方案.
- 自动PM3显著减少了变体解释所需的时间,从而加速了罕见疾病的诊断.
- 开发的方法有可能提高诊断产量,并简化罕见遗传疾病的临床工作流程.
更多相关视频
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
692
11:35Screening for Functional Non-coding Genetic Variants Using Electrophoretic Mobility Shift Assay EMSA and DNA-affinity Precipitation Assay DAPA
Published on: August 21, 2016
13.1K
