聊天GPT在不同检查级别的眼科相关问题上的表现:观察性研究
Firas Haddad1, Joanna S Saade2
1Faculty of Medicine, American University of Beirut, Beirut, Lebanon.
JMIR medical education
|January 18, 2024
概括
在眼科教育中,ChatGPT-4.0显示出前景,正确回答了70%的问题,而ChatGPT-3.5得分为55%. 为了将人工智能整合到医疗培训中,需要进一步改进.
科学领域:
- 医疗教育中的人工智能
- 眼科知识评估知识评估
- 大型语言模型
背景情况:
- 像ChatGPT这样的大型语言模型因其问答能力而受到关注.
- 在医学教育,特别是眼科医学的ChatGPT的实用性,仍然在很大程度上未被探索.
研究的目的:
- 评估ChatGPT-3.5 (GPT-3.5) 和ChatGPT-4.0 (GPT-4.0) 在回答眼科问题的表现.
- 评估各种眼科培训水平的表现,并询问困难.
主要方法:
- 提取了USMLE第一,第二和第三步的问题 (n=132) 和眼科委员会审查问题 (n=248).
- 管理问题与GPT-3.5和GPT-4.0相同,用于分析.
主要成果:
- GPT-4.0实现了70%的准确性,显著超过了GPT-3.5的55%的准确性.
- GPT-4.0在更高水平的USMLE考试中表现更好,但在OB-WQE和难题方面遇到了困难.
- 两种模型都显示了特定主题的性能变化.
结论:
- 目前的ChatGPT模型还不适合眼科主流医学教育.
- 未来的代需要提高准确性和可靠性,以便有效地集成到教育平台中.


