聊天GPT与DeepSeek:评估人工智能对辐射瘤学检查问题的性能
Ronald Chow1,2,3, Ajay Zheng1, Chenxi Gao1
1Department of Radiation Oncology, New York Proton Center, New York, New York.
Advances in radiation oncology
|December 17, 2025
概括
新的大型语言模型DeepSeek-R1在医疗问题上显示精度较低,响应时间比ChatGPT慢. 尽管它更具成本效益,但它的医学准确性在临床使用之前需要仔细评估.
科学领域:
- 人工智能在医学中的应用
- 自然语言处理自然语言处理.
- 医疗教育 技术 技术 医学教育
背景情况:
- 大型语言模型 (LLM) 越来越多地被评估为医学问答能力.
- 新发布的DeepSeek LLM在医疗领域的表现仍然没有被评估.
- 这项研究标志着首次评估DeepSeek对医学查询的准确性.
研究的目的:
- 为了评估DeepSeek-R1大型语言模型的医学准确性.
- 为了比较DeepSeek-R1与ChatGPT在放射瘤学检查问题上的表现.
- 评估两种LLM的响应时间,代币使用和成本效益.
主要方法:
- 600个放射性瘤多选题被用于测试DeepSeek-R1和ChatGPT.
- 准确性,提示/完成令牌和运行时间为每个模型记录.
- 在各个问题类别中分析了表现,I型错误率为0.05.5.
主要成果:
- DeepSeek-R1的准确率达到84.0% (59s/问题),在里程碑研究 (74.2%) 中的表现较低.
- 聊天GPT o1获得了89.0%的准确性 (10s/问题),在里程碑研究中准确度高 (93.5%).
- DeepSeek-R1的代币成本更高,但总体上更便宜 (1.56美元与2025年2月价格的37.96美元相比).
结论:
- 虽然DeepSeek-R1比ChatGPT o1不那么准确和慢,但它的成本效益更高.
- 模型之间的选择需要平衡准确性和效率目标与财务考虑.
- 需要进一步分析,以确定这些LLM在医疗环境中的最佳实施.
更多相关视频
07:57Positron Emission Tomography-based Dose Painting Radiation Therapy in a Glioblastoma Rat Model using the Small Animal Radiation Research Platform
Published on: March 24, 2022
3.1K
08:05Detection and Isolation of Cancer in Prostate Biopsies Using Stimulated Raman Histology and Artificial Intelligence
Published on: June 10, 2025
1.1K
