相关实验视频
Updated: Jan 11, 2026

08:06
Mixed Reality Assisted Radical Endoscopic Thyroidectomy
Published on: January 31, 2025
649
在甲状腺手术的手术前决策中,ChatGPT-4o,Gemini Advanced和DeepSeek R1:与人类外科医生的比较评估
Long Zou1, Peng Zhang1, Yu-Qi Jiang1
1Department of Thyroid and Breast Surgery, The Third Affiliated Hospital of Sun Yat-sen University Lingnan Hospital, Guangzhou, China.
Frontiers in oncology
|November 10, 2025
概括
大型语言模型 (LLM) 在甲状腺手术的手术决策中显示出不同的一致性. 深度搜索R1和ChatGPT-4o的表现优于双子星高级,显示出潜力,但需要进一步验证.
科学领域:
- 手术瘤学手术瘤学
- 人工智能在医学中的应用
- 医疗决策支持 医疗决策支持
背景情况:
- 大型语言模型 (LLM) 越来越多地被用于临床应用.
- 手术决策,特别是在甲状腺手术中,需要高度准确和一致性.
- 对专家的共识进行AI性能评估对于采用至关重要.
研究的目的:
- 评估ChatGPT-4o,Gemini Advanced和DeepSeek R1.0的手术前决策的一致性.
- 将人工智能模型的性能与甲状腺手术规划方面的专家共识进行比较.
- 确定外科瘤学LLM的优势和弱点.
主要方法:
- 对123名甲状腺手术患者的临床数据进行了回顾性分析.
- 将人工智能产生的决策 (甲状腺切除的程度,淋巴结解剖) 与专家共识进行比较.
- 统计分析包括一致率和科恩的卡帕 (κ) 值.
主要成果:
- 总体一致性有所不同:深度搜索R1 (56.10%),聊天GPT-4o (47.97%),双子座高级 (24.39%).
- 在所有模型中都观察到甲状腺切除术程度的中等一致性 (κ ≈ 0.4840.548).
- 淋巴结剖析计划中的显著变化:DeepSeek R1 (79.67%),ChatGPT-4o (69.11%),双子座高级 (34.96%).
结论:
- 聊天GPT-4o和DeepSeek R1显示了与外科医生在手术前规划方面的实质性协议.
- 双子座高级显示出显著的低绩效,特别是在瘤学决策方面.
- 法律学士学位的表现取决于模型,需要进一步细化和临床验证才能安全地采用.

