在分析骨科创伤相关成像时,比较ChatGPT 5,Grok 3 和Claude 4.5 Sonnet之间的有效性
Joshua A Holmstrom1, Collin L Braithwaite2, Ahmad R Alhankawi1
1Mayo Clinic Alix School of Medicine, Scottsdale, AZ.
Journal of orthopaedic trauma
|March 5, 2026
概括
在测试的AI平台中,ChatGPT 5在从X射线和CT扫描中诊断骨折方面显示出最高的准确性. 然而,这些人工智能模型的整体骨折检测准确性仍然很低,不建议用于临床使用.
科学领域:
- 整形外科成像分析分析
- 医学中的人工智能
- 诊断性绩效评价的诊断性绩效评价是什么
背景情况:
- 放射性成像对于诊断创伤相关骨折至关重要.
- 开源人工智能 (AI) 平台越来越多地被用于医疗应用.
- 当前人工智能用于骨科创伤成像的诊断能力需要彻底评估.
研究的目的:
- 为了比较三个流行的开源人工智能平台在识别常见的骨科骨折的诊断性能.
- 评估人工智能模型在解释创伤相关骨折的放射图像中的准确性,灵敏性和特异性.
- 为了评估不同类型的骨折和成像模式 (X射线与CT) 的AI性能.
主要方法:
- 一项回顾性研究,比较人工智能平台的诊断性能.
- 使用了来自Radiopaedia.org的公开可访问的放射图像,并确认了诊断.
- 使用X射线和CT图像对五种常见的骨折类型 (关节,部平原,间,股骨部,腰椎) 进行了测试ChatGPT 5,Grok 3 和Claude 4.5 Sonnet.
主要成果:
- 聊天GPT 5实现了最高的整体诊断准确度 (26.8%),其次是克劳德4.5索内特 (22.4%) 和格洛克3 (18.8%).
- 聊天GPT 5显示了最高的正确分类率为脚,大腿,大腿骨和骨高原骨折.
- 在所有测试的AI平台上,整体骨折检测准确度低 (<27%),X射线和CT模式之间的性能没有显著差异.
结论:
- 与Grok 3和Claude 4.5 Sonnet相比,ChatGPT 5在骨科创伤骨折方面表现出更高的诊断准确性.
- 这些公开可用的大型语言模型 (LLM) 的当前基线版本对放射性解释的诊断准确性有限.
- 这些人工智能平台,以目前的形式,不推用于创伤病例的临床放射成像解释.


