基准测试用于解释世卫组织结核病突变目录的生成性AI工具
Miguel Moreno-Molina1, Anita Suresh1, Rebecca E Colman1,2
1Foundation for Innovative New Diagnostics (FIND), Geneva, Switzerland.
BMC digital health
|March 4, 2026
概括
生成型人工智能模型可以改善对复杂的世界卫生组织 (WHO) 2023年耐药结核病 (TB) 突变目录的访问. 谷歌Gemini 2.5 Pro在准确性和完整性方面显示出最好的性能,用于导航这一关键的结核病资源.
科学领域:
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
- 人工智能在医学中的应用
背景情况:
- 世界卫生组织 (WHO) 2023年突变目录对于解释耐药结核病 (TB) 突变至关重要,但复杂且难以使用.
- 访问和解释世卫组织突变目录的挑战阻碍了有效的结核病控制工作.
研究的目的:
- 评估生成人工智能 (AI) 模型与世界卫生组织突变目录的自然语言交互的潜力.
- 在查询和解释结核病突变数据方面对领先的人工智能模型的性能进行基准测试.
主要方法:
- 一项基准研究评估了四种人工智能模型:谷歌双子 2.5 Pro,OpenAI ChatGPT 4.1,困惑人工智能和DeepSeek R1.
- 评估包括一般查询,从完整目录和抗生素特定表中搜索/检索突变,并对新突变进行评分.
- 绩效指标包括准确性,完整性,清晰性,引用来源和幻觉检测.
主要成果:
- 谷歌Gemini 2.5 Pro显示出更高的准确性,完整性和更少的幻觉,特别是在一般查询和大型数据集搜索中.
- DeepSeek R1在对集中数据集应用分级规则和准确度方面表现出色,但有一些幻觉.
- 聊天GPT 4.1提供了清晰度,但缺乏引用;困惑AI具有可变的性能和更多的幻觉.
结论:
- 生成型人工智能具有显著的潜力,可以提高复杂的知识库的可访问性,如世卫组织突变目录.
- 严格的基准测试对于开发可靠的AI工具来获得结核病突变数据至关重要.
- 虽然还没有临床使用,但像Gemini 2.5 Pro这样的AI模型可以成为未来药物的基础,以帮助结核病控制工作.
更多相关视频
08:46Implementation of In Vitro Drug Resistance Assays: Maximizing the Potential for Uncovering Clinically Relevant Resistance Mechanisms
Published on: December 9, 2015
12.8K
09:40Author Spotlight: Unveiling the Role of TMOD3 in Platinum Resistance and Immune Infiltration in Ovarian Cancer
Published on: August 2, 2024
3.2K
