将ChatGPT-3.5和ChatGPT-4的调整与德国基于证据的S3指南对成人软组织肉瘤进行比较
Cheng-Peng Li1,2, Jens Jakob2, Franka Menge2
1Key Laboratory of Carcinogenesis and Translational Research (Ministry of Education), Sarcoma Center, Peking University Cancer Hospital & Institute, Beijing, China.
iScience
|January 6, 2025
概括
在回答成人软组织肉瘤 (STS) 的临床问题时,ChatGPT-4表现优于ChatGPT-3.5,尽管由于偶尔出现不准确性,这两种模型都需要仔细的临床实施和人类监督.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 在瘤学瘤学.
背景情况:
- 大型语言模型 (LLM) 越来越多地融入医疗保健环境.
- 在临床决策中,对LLM的可靠性评估至关重要.
- 对于成人软组织肉瘤 (STS) 的德国S3指南提供了基于证据的建议.
研究的目的:
- 评估ChatGPT-3.5和ChatGPT-4的临床可靠性.
- 评估在回答复杂的临床问题上的表现,这些问题源自德国S3成人STS指南.
主要方法:
- 制定了80个复杂的临床问题,涵盖STS的诊断,治疗和监测.
- 来自ChatGPT-3.5和ChatGPT-4的响应被两个肉瘤专家独立评分.
- 评分的重点是提供信息的准确性和充分性.
主要成果:
- 与ChatGPT-3.5.5.0相比,ChatGPT-4在准确性 (5.5对5.0) 和充分性 (5.0对4.0) 的中位数得分较高.
- 在一般的STS治疗和四肢/干部肉瘤问题上,ChatGPT-4表现出色.
- 这两种模型在逆皮质/内脏肉瘤,胃肠道 stromal 瘤 (GIST) 治疗和监测问题上表现相似.
结论:
- 在解决与成人软组织肉瘤相关的临床查询方面,ChatGPT-4通常优于ChatGPT-3.5.
- 尽管性能有所改善,但两种LLM都可能产生误导性或潜在有害的信息.
- 谨慎采用和持续的人类监测对于LLMs安全的临床整合至关重要.


