概括
人工智能 (AI) 语言模型在骨科培训考试 (OITE) 上表现不同. 聊天GPT表现出更高的准确性,超过了居民平均水平,这表明了骨科教育的潜力.
科学领域:
- 人工智能的人工智能
- 医学教育 医学教育
- 整形外科手术 整形外科手术
背景情况:
- 生成型人工智能大型语言模型在医疗保健教育中具有潜力.
- 整形外科培训考试 (OITE) 评估住院人员的进展情况.
研究的目的:
- 在2022年OITE上评估AI语言模型的性能.
- 为了比较ChatGPT和Bard在骨科培训评估中的准确性.
主要方法:
- 在2022年的OITE中管理了OpenAI的ChatGPT和谷歌的Bard.
- 输入问题,并没有附带图像的文字描述.
主要成果:
- 聊天GPT实现了69.1%的准确性,在图像描述方面提高到77.8%.
- 巴德实现了49.8%的准确性,在图像描述方面提高到58% (P<.0001).
- 聊天GPT的表现超过了居民平均水平 (66%),并且在与肩膀相关的问题上表现出色.
结论:
- 公共可用的AI模型在OITE上表现出可变的准确性.
- 人工智能工具在骨科教育中具有潜在的作用,例如模拟病例和个性化学习.
- 需要进一步的研究,以确保人工智能在骨科领域的安全采用和降低风险.


