将AAOS适当使用标准与ChatGPT-4o关于治疗远半径骨折的建议进行比较
Kareem S Mohamed1, Alexander Yu1, Christoph A Schroen2
1Department of Orthopaedic Surgery, Icahn School of Medicine at Mount Sinai, New York, NY, United States.
Hand surgery & rehabilitation
|March 13, 2025
概括
聊天GPT-4o显示与专家开发的远距离半径骨折治疗标准不一致,有利于保守的方法,并引起了对临床决策中的AI的担忧.
科学领域:
- 整形外科手术 整形外科手术
- 人工智能在医学中的应用
- 临床决策支持系统 临床决策支持系统
背景情况:
- 美国骨科外科医生学会 (AAOS) 制定了用于远半径骨折管理的适当使用标准 (AUC).
- 评估像ChatGPT-4o这样的先进人工智能模型的准确性与既有临床指南相比是至关重要的.
研究的目的:
- 为了评估ChatGPT-4o对远半径骨折的治疗适当性得分的准确性.
- 将ChatGPT-4o的建议与远半径骨折管理的AAOS AUC进行比较.
主要方法:
- 评估了240个远半径骨折情景,使用AO/OTA分类,损伤机制,患者活动,健康状况和相关损伤.
- 整形外科医生 (AAOS AUC) 和ChatGPT-4o.的治疗适当性得分.
- 统计分析包括误差指标 (平均误差,MAE,MSE) 和斯皮尔曼相关性来比较分数.
主要成果:
- 在AAOS AUC和ChatGPT-4o之间,在背部跨桥 (0.43) 和跨外部固定 (0.4) 之间发现了显著的正相关性.
- 观察到高一致性 (99.17%) 没有减少的固定,和90.42%的飞行锁定板.
- 对于背部涂层,观察到较低的一致性 (15%),表明治疗选项之间的可变一致性.
结论:
- 聊天GPT-4o显示与远半径骨折治疗的AAOS AUC不一致的对齐.
- 人工智能模型对保守管理的倾向引发了人们对其对临床决策支持的可靠性的担忧.
- 在将AI建议纳入骨科治疗计划之前,需要进一步验证.


