聊天GPT-4.0和DeepSeek-R1尚未为膝关节骨关节炎提供临床支持的答案
Haodong Wu1, Shuxin Yao2, Huanli Bao2
1Department of Knee Joint Surgery, Honghui Hospital, Xi'an Jiaotong University, No. 555 E.Youyi Rd, Xi'an 710061, China; Medical College of Yan'an University, Yan'an University, Yan'an 716000, China.
The Knee
|July 6, 2025
概括
像ChatGPT-4.0和DeepSeek-R1这样的大型语言模型 (LLM) 在膝关节关节炎 (KOA) 治疗建议中显示出不同的准确性. 临床医生和患者应谨慎使用人工智能生成的医疗建议.
科学领域:
- 人工智能在医学中的应用
- 整形外科手术 整形外科手术
- 临床指南 临床指南
背景情况:
- 大型语言模型 (LLM) 提供了高级功能,但在医疗环境中引发了准确性问题.
- 对LLM与膝关节骨关节炎 (KOA) 的骨科指南进行系统评估是缺乏的.
- 本研究解决了与KOA临床实践指南相关的LLM绩效评估的需要.
研究的目的:
- 评估ChatGPT-4.0和DeepSeek-R1的准确性和一致性,与中国对KOA的临床实践指南相比.
- 为了比较两个领先的LLM在为KOA管理提供基于证据的建议方面的表现.
主要方法:
- 查询了ChatGPT-4.0和DeepSeek-R1关于指南推的17种KOA治疗策略.
- 两个独立审查员评估了响应与指导方针的一致性.
- 统计学分析了模型之间的评估者间可靠性和响应模式差异.
主要成果:
- 在DeepSeek-R1中,一致性比ChatGPT-4.0 (59%) 高 (71%).
- 两种模型都为特定治疗提供了不一致的建议,例如臭氧治疗和关节镜检查.
- 观察到高的评价者间一致性,但在模型之间的总体一致率上没有显著差异.
结论:
- 目前的LLM并不总是为KOA提供准确,符合指南的医疗建议.
- 这些发现强调了医疗保健专业人员和患者对人工智能产生的医疗信息进行批判性评估的必要性.
- 需要进一步的研究来提高AI在临床决策中的可靠性.


