评估ChatGPT作为肩膀和肘部外科手术信息资源的演变
Orthopedics
|January 29, 2025
概括
与ChatGPT 3.5相比,ChatGPT 4在回答骨科肩膀和肘部手术问题方面表现出更好的准确性,超过了熟练度值. 当前的人工智能模型虽然有用,但无法取代该专业的临床决策.
科学领域:
- 人工智能在医学中的应用
- 骨科手术知识评估知识评估
- 在医疗保健中的自然语言处理.
背景情况:
- 评估像ChatGPT这样的AI聊天机器人对专业医疗信息的实用性至关重要.
- 在骨科手术中评估人工智能性能需要严格对已建立的基准进行测试.
研究的目的:
- 为了评估ChatGPT (3.5和4版本) 对肩膀和肘部手术信息的准确性和演变.
- 将ChatGPT 3.5和4的表现与美国骨科外科医生学院的自我评估问题进行比较.
- 为了确定AI模型是否符合骨科知识的熟练度值.
主要方法:
- 利用了2019年和2021年美国骨科外科医生学院的肩膀-肘部自我评估考试中的200个问题.
- 排除了非文本问题 (114) 和剩余的 ChatGPT 3.5 和 4 的输入.
- 在各个类别 (解剖学,关节整形等) 中量化表现. 使用奇平方测试,50%的正确答案定义了熟练程度.
主要成果:
- 聊天GPT 4实现了73.3%的准确性,显著超过了ChatGPT 3.5的52.3% (P=.003).
- 这两种模型都超过了50%的熟练度值.
- 聊天GPT 4在各类别中表现一致 (P=.841),而聊天GPT 3.5在不稳定性方面表现出色 (P=.037).
结论:
- 与ChatGPT 3.5.5相比,ChatGPT 4在回答骨科肩膀和肘部问题方面表现出更强大的能力.
- 这两种AI版本都超过了最低熟练度基准.
- 目前的AI准确性不足以取代骨科决策中的临床判断,尽管未来的代可能会提高效用.


