评估人工智能驱动对急性肝衰竭查询的反应:对准确性,清晰性和相关性进行比较分析
Sheza Malik1, Lewis J Frey2, Jason Gutman3
1Internal Medicine, Rochester General Hospital, Rochester, New York, USA.
The American journal of gastroenterology
|December 17, 2024
概括
大型语言模型 (LLM) 在医疗保健方面表现有前途. 采用检索增强生成 (RAG) 的ChatGPT 4在准确性,清晰性和急性肝衰竭查询的相关性方面明显优于其他AI模型.
科学领域:
- 人工智能在医学中的应用
- 临床决策支持系统 临床决策支持系统
- 大型语言模型 (LLM)
背景情况:
- 人工智能 (AI) 和大型语言模型 (LLM) 正在越来越多地影响医疗保健应用.
- 评估各种LLM在处理复杂的医疗查询方面的表现对于安全的整合至关重要.
研究的目的:
- 评估五个领先的LLM (ChatGPT 3.5,ChatGPT 4,BARD,CLAUDE,COPILOT) 在应对急性肝衰竭 (ALF) 临床情景中的准确性,清晰性和相关性.
- 为了比较标准LLM与ChatGPT 4的性能,使用检索增强生成 (RAG) 技术进行增强.
主要方法:
- 根据现实世界的病例和指导方针开发了16个ALF相关的临床问题.
- 通过"新聊天"为每个LLM单独管理查询,以最大限度地减少偏见.
- 通过四名独立调查人员使用5分利克特度表来评估答案的准确性,清晰性和相关性.
主要成果:
- 使用RAG的ChatGPT 4在所有指标中获得了最高分 (准确度:4.70,清晰度:4.89,相关性:4.78).
- 标准聊天GPT 4表现出强的性能 (准确度:3.67,清晰度:4.04,相关性:4.01).
- 克劳德,巴德和COPILOT表现较差,巴德和COPILOT在准确性和相关性方面表现最不利.
结论:
- 与RAG集成的ChatGPT 4为医疗查询提供了卓越的性能,将生成能力与事实依据相结合.
- 通过提高准确性,清晰性和相关性,RAG增强了医疗保健中的LLM响应.
- 持续的AI模型演变和与医疗实践的调整对于成功的医疗整合至关重要.
更多相关视频
06:12Inducing Acute Liver Injury in Rats via Carbon Tetrachloride CCl4 Exposure Through an Orogastric Tube
Published on: April 28, 2020
11.2K
04:09Predicting Treatment Response to Image-Guided Therapies Using Machine Learning: An Example for Trans-Arterial Treatment of Hepatocellular Carcinoma
Published on: October 10, 2018
8.2K
