系统性基准测试表明,大型语言模型尚未达到传统罕见疾病决策支持工具的诊断准确性
Justin T Reese1, Leonardo Chimirri2, Yasemin Bridges3
1Division of Environmental Genomics and Systems Biology, Lawrence Berkeley National Laboratory, Berkeley, CA, USA.
European journal of human genetics : EJHG
|February 24, 2026
概括
大型语言模型 (LLM) 显示出诊断遗传疾病的潜力,但落后于传统生物信息学工具. 需要进一步的研究,以有效地将LLMs集成到诊断工作流程中.
科学领域:
- 医疗信息学 医疗信息学
- 人工智能在医学中的应用
- 基因组医学是基因组医学.
背景情况:
- 大型语言模型 (LLM) 提供了差异诊断的潜力,但由于非结构化输出和非特征性准确性,面临评估挑战.
- 与已建立的诊断工具对LLM性能进行评估对于理解其临床实用性至关重要.
研究的目的:
- 将七个LLM的诊断能力与用于遗传疾病诊断的传统生物信息学工具进行比较.
- 评估LLM在从复杂病例报告中识别正确诊断方面的准确性.
主要方法:
- 利用了5213个已发表的遗传疾病病例报告,这些病例报告使用Phenopacket Schema进行了结构化.
- 输入病例数据到四个全科医生和三个医学LLM,以及Exomiser工具.
- 来自LLM分析的phenopackets生成提示,并用于Exomiser的仅表型模式.
主要成果:
- 在23.6%的案例中,表现最好的LLM在23.6%的案例中实现了第一级诊断.
- 传统工具Exomiser在35.5%的病例中正确地将诊断放在第一位.
- 虽然LLM的表现有所改善,但尚未与已建立的生物信息学诊断工具相匹配.
结论:
- 目前的LLM还没有达到传统生物信息学工具对遗传疾病的诊断准确度.
- 临床临床诊断仪表表现有前途,但需要进一步发展,才能有效地融入临床诊断管道.
- 未来的研究应该专注于优化在诊断工作流程中的LLM应用.


