评估大型语言模型,以符合WAO/EAACI在遗传性血管管理中的指南
Mehmet Emin Gerek1, Tuğba Önalan2, Fatih Çölkesen2
1Department of Internal Medicine, Division of Clinical Immunology and Allergy, Necmettin Erbakan University, Faculty of Medicine, Konya, Türkiye; drmegerek@gmail.com.
像ChatGPT和Gemini这样的大型语言模型 (LLM) 在遵守临床指导方针时,在治疗遗传性血管 (HAE) 方面表现有前途. 由于引用不一致,需要进一步验证.
科学领域:
- 人工智能在医学中的应用
- 临床决策支持系统 临床决策支持系统
- 罕见疾病管理 罕见疾病管理
背景情况:
- 遗传性血管 (HAE) 是一种罕见的,危及生命的疾病,需要严格遵守临床指导方针,以有效管理.
- 人工智能 (AI),特别是大型语言模型 (LLM),为增强罕见疾病的临床决策支持提供了一个新的机会.
研究的目的:
- 评估领先的LLM (ChatGPT,Gemini,Perplexity,Copilot) 在为遗传性血管 (HAE) 管理产生符合指导方针的反应方面的表现.
- 根据WAO/EAACI指南评估LLM产生的内容的准确性,充分性,清晰性和引用可靠性.
主要方法:
- 来自WAO/EAACI HAE指南的28个关键建议被转化为四个LLM的问题.
- 两位独立的临床医生使用五分利克特级别来评估答案的准确性,充分性,清晰性和引用可靠性.
- 重新评估阶段包括明确的引用说明,以评估绩效的一致性.
主要成果:
- 聊天GPT和Gemini表现出卓越的性能,平均准确性和充分性得分为5.0,而困惑性和副驾驶员得分为3.0.
- 聊天GPT表现出最低的不可靠引用率;双子座显示出不一致的引用行为,这种行为在明确的指令下得到改善.
- 在LLM中观察到响应质量的统计学上显著差异 (p < 0.001).
结论:
- 通过遵守既定指南,ChatGPT和Gemini显示出在像HAE这样的罕见疾病中支持临床决策的巨大潜力.
- 在引用实践中观察到的不一致性需要进一步的研究和优化,以确保在医疗应用中LLM的可靠性.
更多相关视频
07:15Determining the Likelihood of Variant Pathogenicity Using Amino Acid-level Signal-to-Noise Analysis of Genetic Variation
Published on: January 16, 2019
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
相关概念视频
Heart Failure Drugs: Inhibitors of Renin-Angiotensin System
Aortic Regurgitation III: Medical Management
Aneurysm III: Interprofessional Care
