大型语言模型在头部和部癌症分期中的确认
Mehmet Kayaalp1,2, Hatice Bölek1,2, Hatime Arzu Yaşar1,2
1Department of Medical Oncology, Ankara University Faculty of Medicine, Ankara University, Ankara 06620, Turkey.
Diagnostics (Basel, Switzerland)
|September 27, 2025
概括
大型语言模型 (LLMs) 在分期头癌 (HNC) 中显示出高准确度. 这些人工智能工具,包括ChatGPT,DeepSeek和Grok,在进一步研究后,可能会在瘤学中变得有价值.
科学领域:
- 在瘤学瘤学.
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 头癌 (HNC) 的分期对治疗和预后至关重要.
- 大型语言模型 (LLM) 是新兴的人工智能工具,在瘤学中具有潜在的应用.
- 对于HNC分期的LLMs的临床实用性需要评估.
研究的目的:
- 评估LLM为HNC生成的分期的准确性和一致性.
- 为了比较LLM阶段表现与临床医生分配的阶段.
主要方法:
- 对202个HNC患者记录的回顾性审查.
- 由研究人员进行的临床分期.
- 由一个盲目的研究人员使用非识别数据进行的LLM分期 (ChatGPT,DeepSeek,Grok).
- 对LLM和临床医生分期结果的比较.
主要成果:
- 聊天GPT获得了最高的一致性 (85.6%),其次是Grok (75.2%) 和DeepSeek (67.3%).
- 在LLM模型之间没有观察到统计学意义上的差异.
- 在不同的数据输入 (成像,病理学,体检) 和分期类型 (病理学,手术) 中,一致性相似.
结论:
- 在分期HNC时,LLM表现出显著的准确性.
- 这些人工智能模型在瘤实践中显示出作为支持工具的前景.
- 为临床实施,建议进行进一步的前性研究.


