系统性基准测试表明,大型语言模型尚未达到传统罕见病决策支持工具的诊断准确性

Justin T Reese1,2, Leonardo Chimirri2,3, Yasemin Bridges2,4

  • 1Division of Environmental Genomics and Systems Biology, Lawrence Berkeley National Laboratory, Berkeley, CA, USA.

概括

大型语言模型 (LLM) 显示出诊断遗传疾病的潜力,但落后于传统工具. 基准测试显示,LLM在23.6%的病例中正确识别了诊断,而Exomiser的情况为35.5%.