在癌症查算法中使用快速工程对ChatGPT和Google Bard的评估
Daniel Nguyen1, Daniel Swanson1, Alex Newbury2
1University of Massachusetts Chan Medical School, Worcester, Massachusetts (D.N., D.S.).
Academic radiology
|December 16, 2023
概括
大型语言模型 (LLM) 在临床决策中显示出潜力,ChatGPT和Bard显示出可比的准确性. 快速工程为开放式问题提供了微小的改进,但没有选择适用于所有问题的格式.
科学领域:
- 人工智能在医学中的应用
- 临床决策支持系统 临床决策支持系统
- 放射学 信息学 信息学
背景情况:
- 像ChatGPT和Bard这样的大型语言模型 (LLM) 越来越多地用于医疗任务,包括放射学报告翻译和研究起草.
- 尽管它们具有潜力,但在临床环境中LLM反应的准确性是不一致的,需要仔细评估.
研究的目的:
- 评估ChatGPT和Bard在临床决策中的准确性,使用美国放射学学院针对癌症相关情景的适当性标准.
- 评估快速工程 (PE) 技术对不同问题格式的LLM答案准确性的影响.
主要方法:
- 根据既定的临床指南,ChatGPT和Bard使用开放式 (OE) 和选择所有适用的 (SATA) 提示进行了测试.
- 应用了快速工程技术来研究它们对LLM输出准确性的影响.
- 两种LLM之间以及不同类型的提示符之间进行了性能比较.
主要成果:
- 在OE提示时,ChatGPT和Bard的表现类似.
- 在SATA提示中,ChatGPT在Bard上显示出轻微的精度优势.
- 快速工程略有改善了OE快速响应,但并没有显著提高SATA快速的准确性.
结论:
- 作为协助放射学临床决策的工具,LLM显得有前途,特别是当提示被精心设计时.
- 为了充分理解LLM在放射学实践中的作用和局限性,在各种临床环境中进行进一步的研究是必不可少的.
更多相关视频
09:33Author Spotlight: Finding New Therapeutic Targets for Malignant Peripheral Nerve Sheath Tumor Through Genome-Scale shRNA Screens
Published on: August 25, 2023
1.2K
13:24Integration of Wet and Dry Bench Processes Optimizes Targeted Next-generation Sequencing of Low-quality and Low-quantity Tumor Biopsies
Published on: April 11, 2016
11.9K
