深度搜索与聊天GPT:对他们的表现进行了比较研究,以多种语言回答前列腺癌放射治疗问题
Peng-Wei Luo1,2, Ji-Wen Liu3, Xi Xie2
1Department of Urology, Fujian Union Hospital, Fujian Medical University Fuzhou, Fujian, China.
概括
在中国的前列腺癌放射治疗信息中,DeepSeek的表现优于ChatGPT. 在英语中,两种大型语言模型 (LLM) 都显示出相似的性能,突出了医学中对语言特定AI的需求.
科学领域:
- 在瘤学中使用人工智能
- 医学自然语言处理 医学自然语言处理
- 辐射治疗决策支持支持
背景情况:
- 大型语言模型 (LLM) 对患者教育和医学临床决策日益至关重要.
- 评估LLM在专业医疗领域的表现,如前列腺癌放射治疗,对于安全实施至关重要.
- 需要对不同语言环境中的LLM进行比较分析,以了解它们的适用性.
研究的目的:
- 评估和比较DeepSeek和ChatGPT在回答前列腺癌放射治疗问题的表现.
- 评估这些LLM在中文和英语语言环境中产生的响应质量.
- 根据语言背景,确定最佳的医学信息提供LLM.
主要方法:
- 使用了一个结构化的评估框架,在基础知识,患者教育和治疗/随访领域中提出了临床相关的问题.
- 来自DeepSeek和ChatGPT的英语和中文答案由五位瘤学专家在五分利克特级别上独立评估.
- 统计分析,包括威尔科克森签名等级测试,用于在语言背景下比较模型性能.
主要成果:
- 在中国的回复中,DeepSeek显著超过了ChatGPT,在75.76%的案例中获得了最高评级,而36.36% (P < 0.001).
- 在英语中,ChatGPT和DeepSeek表现相似,分别为66.7%和54.55%的最高评级响应 (P = 0.236).
- DeepSeek在中国基础知识和治疗/随访方面表现特别强,同时在英语基础知识和患者教育方面保持强表现.
结论:
- 在提供与前列腺癌放射治疗相关的中国医疗信息方面,DeepSeek表现出卓越的性能.
- 两种LLM在英语中都表现出类似的能力,这表明特定语言的优化显著影响了性能.
- 这些发现强调了为医疗应用选择特定语言AI模型的重要性,并强调了人类专家审查的持续必要性.
更多相关视频
04:09Predicting Treatment Response to Image-Guided Therapies Using Machine Learning: An Example for Trans-Arterial Treatment of Hepatocellular Carcinoma
Published on: October 10, 2018
8.2K
07:41Performing Data Mining And Integrative Analysis Of Biomarker in Breast Cancer Using Multiple Publicly Accessible Databases
Published on: May 17, 2019
8.8K
