在骨科瘤学中ChatGPT-4的诊断准确性:与住院医生进行的比较研究
Hayden P Baker1, Sarthak Aggarwal1, Senthooran Kalidoss1
1The University of Chicago Department of Orthopaedic Surgery, Chicago, IL 60637, United States.
The Knee
|May 1, 2025
概括
骨科住院医生在通过组织学幻灯片诊断肌肉骨瘤方面显著优于ChatGPT-4. 目前的AI模型,如ChatGPT-4,在这个专业领域的独立临床使用中显示出有限的准确性.
科学领域:
- 在瘤学瘤学.
- 人工智能的人工智能
- 医学诊断 医学诊断 医学诊断
背景情况:
- 人工智能 (AI) 正在探索用于医学诊断.
- 像ChatGPT-4这样的大型语言模型 (LLM) 与图像分析可能有助于他的病理学.
- 聊天GPT-4在肌肉骨瘤组织病理学方面的准确性未经评估.
研究的目的:
- 从组织学幻灯片评估ChatGPT-4对肌肉骨瘤的诊断准确度.
- 为了比较ChatGPT-4的性能与骨科外科住院医生.
主要方法:
- 一项比较性研究使用了来自骨科瘤学注册表的24张组织学幻灯片.
- 五组骨科外科住院医生 (PGY-1至PGY-5) 提供了诊断.
- 聊天GPT-4被测试了两次,使用相同的图像和临床图片.
- 统计分析包括ANOVA和独立的t测试.
主要成果:
- 骨科住院医生实现了55%的平均诊断准确度,明显超过了ChatGPT-4 (25%的第一次尝试,33%的第二次尝试).
- 统计测试证实了居民的优异表现 (p < 0.05).
- 居民和ChatGPT-4都面临软组织肉瘤的挑战.
结论:
- 与骨科住院医生相比,ChatGPT-4在组织病理学解释中显示出有限的准确性.
- 目前的人工智能能力不足以在肌肉骨瘤学中独立临床使用.
- 建议使用更大的数据集和训练为组织病理学的人工智能模型进行进一步研究.


