人工智能驱动的聊天机器人在回答骨科研究生考试问题的有效性 - 一项观察性研究
Raju Vaishya1, Karthikeyan P Iyengar2, Mohit Kumar Patralekh3
1Department of Orthopaedics, Indraprastha Apollo Hospitals, Sarita Vihar, New Delhi, 110076, India. raju.vaishya@gmail.com.
International orthopaedics
|April 15, 2024
概括
与ChatGPT-3.5和ChatGPT-4.0相比,谷歌巴德AI在回答研究生骨科多选题方面表现优异,突出的是AI.
科学领域:
- 医疗教育中的人工智能
- 整形医疗知识评估评估
- 在医疗保健中的自然语言处理.
背景情况:
- 人工智能 (AI) 生产聊天机器人越来越多地被用于各种专业领域.
- 评估AI在骨科等专业医疗领域的熟练程度对于教育应用至关重要.
- 评估AI在回答研究生水平考试中的表现,可以了解它们的知识处理能力.
研究的目的:
- 分析ChatGPT-3.5,ChatGPT-4.0和Bard Google AI在回答研究生骨科资格考试多选题中的性能和熟练程度.
- 在高风险的医学检查环境中比较不同AI生成聊天机器人的有效性.
主要方法:
- 编制了一组120个模拟单一最佳答案 (SBA) 多选题,涵盖与骨科课程相关的肌肉骨疾病.
- 使用标准化的文本提示符输入问题到ChatGPT (3.5和4.0版本) 和谷歌Bard.
- 每个AI模型生成的响应都被统计分析以确定性能指标.
主要成果:
- 在ChatGPT-3.5和ChatGPT-4.0.0之间的反应中观察到显著的差异.
- 巴德谷歌AI在回答问题方面实现了100%的效率.
- 与ChatGPT-3.5和ChatGPT-4.0相比,Bard Google AI的效率显著更高 (p < 0.0001).与ChatGPT-3.5和ChatGPT-4.0相比,Bard Google AI的效率显著更高 (p < 0.0001).与ChatGPT-4.0相比,Bard Google AI的效率显著更高.
结论:
- 人工智能生成聊天机器人在回答研究生骨科多选题时表现出不同的表现.
- 巴德谷歌AI超越了ChatGPT的两个版本,表明其在研究生水平处理和应用专门的骨科知识方面的高级能力.
- 这些发现强调了大型语言模型在支持医学教育和骨科知识评估方面的潜力.


