评估用于微创脊椎外科手术决策支持的大型语言模型 选和程序类别
Ahmet Kartal1, Noel F Manalil1, Chiungwen D Cheng1
1Department of Neurological Surgery, Och Spine at NewYork-Presbyterian Hospital, New York, NY, USA.
Global spine journal
|December 22, 2025
概括
生成型人工智能 (AI) 在微创脊椎手术 (MISS) 的手术与非手术分离方面表现有前途. 然而,随着人工智能模型的成熟,专家监督对于程序选择至关重要.
科学领域:
- 神经外科 神经外科
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 生成型人工智能 (AI),特别是大型语言模型 (LLM),正在越来越多地影响医疗决策.
- 在微创脊椎手术 (MISS) 中LLM的应用正在出现,但需要严格的评估.
研究的目的:
- 评估OpenAI的ChatGPT-5 Pro和谷歌的Gemini 2.5 Pro对发布的MISS案例进行分类管理的能力.
- 测量LLM生成的类别与专家分类在程序和二进制分类层的一致性.
主要方法:
- 这是一项横截面研究,使用了90个从已发表的MISS病例报告中获得的临床细节.
- 要求LLM分配管理类别,使用詹森-香农分歧,斯图尔特-马克斯韦尔测试,科恩的卡帕和麦克纳马的测试来评估协议.
主要成果:
- 这两种LLM都显示出与专家参考类别的小差异 (JSD:ChatGPT-5 Pro的0.115;Gemini 2.5 Pro的0.112).
- 对于ChatGPT-5 Pro (κ=0.146) 的案例级一致性很小,而对于Gemini 2.5 Pro (κ=0.245) 的案例级一致性很大.
- 当将类别归结为手术与非手术分类时,一致性显著改善 (κ=0.415-0.587与参考; κ=0.692在模型之间).
结论:
- 在MISS中,LLM在区分手术和非手术分拣建议方面显示出潜力.
- 在AI系统达到更大的成熟度之前,专家临床判断对于MISS中最终的程序选择至关重要.
- 这些发现为将LLM整合到外科分拣工作流程中提供了基础的理解,突出了AI在精确脊柱护理中的潜力和局限性.

