通过透明的来源归因增强临床医生对大语言模型的信任:尿瘤学的随机对照评估
Nicolas Carl1, Martin Joachim Hetz2, Christoph Wies2
1Department of Urology, University Medical Center Mannheim, Ruprecht-Karls University of Heidelberg, Mannheim, Germany; Division of Digital Prevention, Diagnostics and Therapy Guidance, German Cancer Research Center (DKFZ), Heidelberg, Germany.
使用检索增强生成 (RAG) 的新型泌尿器官聊天机器人UroBot在临床决策支持的准确性和源验证方面明显优于ChatGPT. 这种RAG方法提高了医疗应用中对AI的可靠性和信任.
科学领域:
- 人工智能在医学中的应用
- 泌尿瘤学临床决策支持
背景情况:
- 泌尿病学和瘤学的大型语言模型 (LLM) 面临着由于过时的数据和缺乏来源透明度的局限性.
- 这些局限性阻碍了临床可靠性和在医疗保健中采用人工智能工具.
研究的目的:
- 开发和评估UroBot,一个专门用于泌尿病的聊天机器人,增强了检索增强生成 (RAG).
- 为了比较UroBot与ChatGPT在提供准确和可验证的临床建议方面的表现.
主要方法:
- UroBot是通过整合RAG来开发的,用于在线引用和源文本预览.
- 一项随机控制的读者研究比较了UroBot和ChatGPT在十个神经瘤病例中.
- 30名泌尿科医生评估了建议的正确性,来源可验证性和信任性.
主要成果:
- 与ChatGPT相比,UroBot表现出优越的推正确性 (73%对50%),来源归因 (74%对30%) 和可验证性 (84%对35%).
- 临床医生始终更喜欢UroBot的准确性,可验证性和信任性.
- 聊天GPT提供了模糊或不正确的引用,其中28%不存在/过时,83%缺乏特定部分,而UroBot实现了精确的引用对齐.
结论:
- 将LLM与RAG结合起来,比传统的LLM显著提高了来源归因和可验证性.
- 这种RAG增强的方法提供了可靠和最新的临床决策支持.
- 该方法在医学子专业之间是可转移的.
更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
09:28Patient-derived Orthotopic Xenograft Models for Human Urothelial Cell Carcinoma and Colorectal Cancer Tumor Growth and Spontaneous Metastasis
Published on: May 12, 2019
相关概念视频
Improving Translational Accuracy
Improving Translational Accuracy
Blinding
