辐射瘤学GPT-5的基准测试:可以衡量的收益,但需要专家监督的持续需求
Udo S Dinc1,2,3, Jibak Sarkar1,2,3, Philipp Schubert1,2,3
1Department of Radiation Oncology, University Hospital Erlangen, Friedrich-Alexander-Universität Erlangen-Nürnberg, Erlangen, Germany.
Frontiers in oncology
|December 29, 2025
概括
GPT-5在放射瘤学评估中表现出卓越的表现,在多选择性检查中显著优于以前的模型,并且在生成治疗计划方面表现有前途. 然而,由于复杂案件中偶尔出现错误,专家监督仍然至关重要.
科学领域:
- 人工智能在医学中的应用
- 辐射瘤学 辐射瘤学
- 临床决策支持 临床决策支持
背景情况:
- 大型语言模型 (LLM) 在临床决策支持和医学教育方面显示出潜力.
- GPT-5是一个新的LLM系统,用于瘤学应用.
- 这项研究对GPT-5在放射瘤学方面的能力进行了基准测试.
研究的目的:
- 在放射瘤学中全面比较GPT-5的性能.
- 将GPT-5的性能与之前的LLM变体 (GPT-3.5和GPT-4) 的性能进行比较.
- 评估GPT-5在多选择性检查中的准确性及其生成临床治疗计划的能力.
主要方法:
- 使用美国放射学学院放射瘤学培训内检查 (TXIT) 评估的性能,包括300个多选项项.
- 使用60个真实的放射瘤病例进行评价,评估GPT-5生成的治疗计划和摘要.
- 由四位经过董事会认证的放射瘤学家对正确性,全面性和幻觉进行评分,并量化了评级者之间的可靠性.
主要成果:
- 在TXIT上,GPT-5的精度达到了92.8%,超过了GPT-4 (78.8%) 和GPT-3.5 (62.1%).
- 维涅特评估显示,治疗建议的正确性 (3.24/4) 和全面性 (3.59/4) 的评分很高.
- 幻觉很少发生 (10.0%),但错误发生在复杂的病例中,评审者之间的一致性很低 (Fleiss' κ 0.083).
结论:
- 在辐射瘤学基准上,GPT-5显著优于之前的LLM.
- 虽然GPT-5在产生治疗建议方面有效,但由于潜在的错误,需要专家监督.
- 评价者之间的变化凸显了对人工智能生成的临床计划的一致专家评估的挑战.


