评估大型语言模型对患者关于腰椎侧带修复问题的反应
Benjamin W King1, Evan P Bailey1, Eric Warren1
1Department of Orthopedics, Emory University School of Medicine, Atlanta, GA, USA.
Clinics in shoulder and elbow
|February 27, 2026
概括
人工智能 (AI) 模型通常提供关于侧带 (UCL) 修复的准确信息,但读数水平太高,无法让患者理解. 与其他人工智能模型相比,双子号显示出更高的准确性,但可读性较低.
科学领域:
- 整形外科 整形外科 整形外科
- 医疗人工智能 医疗人工智能
- 患者教育 患者教育
背景情况:
- 侧带 (UCL) 修复的发生率正在上升.
- 评估人工智能生成的关于UCL修复信息的准确性和可读性对于患者的理解至关重要.
- 这项研究评估了AI对有关UCL修复的常见患者查询的反应.
研究的目的:
- 评估人工智能生成的对常见患者关于侧带 (UCL) 修复问题的答案的准确性和可读性.
- 为了比较不同的人工智能模型 (ChatGPT,Gemini,Grok) 在提供这些信息方面的表现.
主要方法:
- 关于UCL修复的20个常见患者问题提交给ChatGPT,Gemini和Grok.
- 整形外科医生使用ChatGPT响应评分系统 (CRRS) 和AI响应度量 (AIRM) (1-5级,更低更好) 评估响应的准确性.
- 使用弗莱什-金凯德阅读易度 (FKRE) 和等级水平 (FKGL) 评估可读性;FKGL>6超过了AMA/NIH建议.
主要成果:
- 双子座的准确性明显更好 (CRRS,1.5±0.5;AIRM,1.6±0.5) 比ChatGPT和Grok.
- 对于5%的双子座回复,需要进行超过最小的澄清,而对于ChatGPT则需要15%,对于Grok.则需要40%的澄清.
- 所有的AI反应都超过了6年级推的阅读水平 (FKGL>6),而双子座的FKGL最高 (16.2±2.2).
结论:
- 人工智能模型通常提供关于UCL修复的准确信息,但读数水平不适合患者教育.
- 双子座是评估的最准确的人工智能模型,尽管它产生了最难读的内容.
- 要达到推的可读性标准,需要进一步完善人工智能生成的患者教育材料.


