对大型语言模型对罕见疾病知识的系统评估:大型语言模型对罕见疾病的了解有多大?
Tudor Groza1, Allison J Marcello2, Tristan Carlisle3
1Bioinformatics Institute (BII), Agency for Science, Technology and Research (A∗STAR), Singapore, Singapore; Maternal and Child Health Research Institute, KK Women's and Children's Hospital, Singapore, Singapore; Genetics Service, KK Women's and Children's Hospital, Singapore, Singapore; SingHealth Duke-NUS Institute of Precision Medicine, Singapore, Singapore.
大型语言模型通过识别基因和表型,在罕见疾病 (RD) 研究中显示出前景,但精度有限. 混合方法将专家知识与LLM输出结合起来,可以改善RD诊断.
科学领域:
- 人工智能在医学中的应用
- 基因组学和罕见疾病
- 计算生物学 计算生物学
背景情况:
- 大型语言模型 (LLM) 在一般医疗任务中表现出色,但它们在罕见疾病 (RD) 推理中的实用性是不确定的.
- 对一组全面的RD相关基因和表型进行LLM的评估对于理解其能力至关重要.
研究的目的:
- 系统地评估领先的通用领域LLM产生核心表型特征和10892个孤儿罕见疾病的因果基因的能力.
- 用集合重叠,语义相似性和临床异常排名框架将LLM生成的输出与精选的知识库进行比较.
主要方法:
- 六位著名的LLM被评估了他们对RD相关基因和表型的知识.
- 输出被映射到人类现象型本体学 (HPO) 术语和HGNC基因符号.
- 绩效被评估使用集重叠,语义相似性,和情的框架与8000名患者Phenopackets.
主要成果:
- 总体而言,LLM对精选的RD知识的回忆率很低;基因关联比表型更准确.
- 商业模型 (GPT-4,Claude) 显示基因关联的回忆率高于60%,但在表型精度方面遇到了困难.
- 从LLM衍生出来的类型特征显示了中度的语义相似性,在LIRICAL排名中接近金标准的表现,尽管直接诊断的准确性有限.
结论:
- 目前的通用LLM缺乏准确性来取代精心策划的研发和开发知识库,但提供了补充,语义相关的信息.
- 跨模型的融合,非策划术语表明在罕见疾病研究中产生假设的潜力.
- 综合专家策划与LLM输出的混合方法可以增强和扩展本体学驱动的RD诊断.
更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
07:35A Knowledge Graph Approach to Elucidate the Role of Organellar Pathways in Disease via Biomedical Reports
Published on: October 13, 2023
相关概念视频
Classification of Illness
An illness is a response to a disease in which the person's level of functioning is changed compared with a previous level. The general classification of illness includes acute and chronic.
Acute illness is severe...
Lysosomal Hydrolases
