聊天GPT-4o不是一个可靠的研究来源,为整形外科住院医生
Neil Jain1, Caleb Gottlich2, John Fisher2
1Department of Orthopaedic Surgery, St. Luke's University Health Network, Bethlehem, Pennsylvania.
JB & JS open access
|September 10, 2025
概括
人工智能 (AI) 工具ChatGPT-4o在骨科手术考试中表现不一致,得分与住院医生相似,但解释有缺陷. 它用于医学教育需要进一步验证.
科学领域:
- 医学教育 医学教育
- 人工智能在医学中的应用
- 整形外科手术 整形外科手术
背景情况:
- 像ChatGPT这样的人工智能平台的采用在医疗人员中以教育目的而上升.
- 之前的ChatGPT版本在考试中表现不佳,与骨科外科住院医生相比,特别是在基于图像的问题上.
- 聊天GPT-4o是一种较新的模式,旨在解决这些局限性,但需要评估.
研究的目的:
- 评估ChatGPT-4o在回答骨科培训考试 (OITE) 问题的准确性.
- 为了评估ChatGPT-4o对骨科外科学员的解释的教育质量.
主要方法:
- 聊天GPT-4o处理了2020-2022年的OITE问题.
- 人工智能的原始分数与ACGME认可的骨科住院医生的表现进行了比较.
- 分析了答案解释与AAOS专家内容的一致性,将答案分类为理想的,不充分的或不可接受的.
主要成果:
- 聊天GPT-4o的得分分别为68.8% (2020年),63.4% (2021年) 和70.1% (2022年),相当于PGY-5,PGY2-3和PGY-4居民的得分.
- 理想的答案质量 (正确的答案与一致的解释) 在58.7%的问题上得到了实现.
- 基于媒体的问题 (60.0%) 的表现明显低于非媒体问题 (73.1%).
结论:
- 聊天GPT-4o在OITE上表现不一致,很大一部分响应是不可接受的或缺乏足够的解释.
- 人工智能在处理基于媒体的骨科手术问题的局限性仍然存在.
- 使用ChatGPT用于整形外科住院教育的有效性仍未得到验证.


