对于高级头恶性瘤管理的大型语言模型的可靠性:ChatGPT 4和Gemini Advanced之间的比较
Andrea Lorenzi1, Giorgia Pugliese2, Antonino Maniaci3,4
1Division of Otolaryngology, Department of Surgical Sciences, Università degli Studi di Torino, Turin, Italy.
概括
聊天GPT 4和双子座高级显示潜在的头部和部瘤治疗建议. 聊天GPT 4在遵守指南和全面规划方面普遍优于双子星高级,尽管这两者都需要进一步精细化以进行临床集成.
科学领域:
- 在瘤学瘤学.
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 大型语言模型 (LLM) 越来越多地被用于临床决策支持.
- 头瘤学需要复杂的,多学科的治疗计划.
- 在专业医疗领域评估人工智能的有效性至关重要.
研究的目的:
- 评估ChatGPT 4和Gemini Advanced在产生头癌治疗建议方面的疗效.
- 评估这些LLM在支持瘤多学科团队会议中的实用性.
- 将AI产生的建议与当前的临床指南进行比较.
主要方法:
- 对ChatGPT 4和Gemini Advanced对五个假设的头癌病例的反应进行比较分析.
- 国家综合癌症网络 (NCCN) 准则的评估,由盲目的专家小组进行.
- 使用总分歧得分 (TDS) 和人工智能性能仪器 (AIPI) 进行评估.
主要成果:
- 两位LLM都为头瘤学提供了相关的治疗建议.
- 与Gemini Advanced相比,ChatGPT 4在遵守指南和完整治疗计划方面表现优越.
- 聊天GPT 4 (中位数3) 的AIPI得分高于双子座高级 (中位数2),表明效用更好.
结论:
- 在协助头癌治疗方面,LLM显得有前途,但需要进一步发展.
- 人工智能对化疗和手术决策的建议不一致需要谨慎.
- 持续验证和更新对于在瘤学中安全有效地整合人工智能至关重要.


