人工智能工具在回答紧急医疗问题池中的性能比较:ChatGPT 4.0,谷歌Gemini和微软Copilot
Iskender Aksoy1, Merve Kara Arslan2
1Iskender Aksoy Department of Emergency Medicine, Faculty of Medicine, Giresun University, 28100, Giresun, Turkey.
Pakistan journal of medical sciences
|April 28, 2025
概括
微软Copilot在紧急医疗考试问题中展示了测试的AI聊天机器人中最高的准确性,而谷歌Gemini的错误率最高. 人工智能工具可以帮助医学教育,但不应该取代初级学习资源.
科学领域:
- 医疗教育 技术 技术 医学教育
- 医疗保健中的人工智能
- 紧急医疗 紧急医疗
背景情况:
- 人工智能 (AI) 工具越来越多地被用于医学中的临床和教育应用.
- 评估AI聊天机器人在专业医疗知识领域的有效性至关重要.
研究的目的:
- 为了比较三个AI聊天机器人 (ChatGPT-4,Gemini,Copilot) 在土耳其国家医疗专业考试中的紧急医疗问题上的表现.
- 分析问题内容,形式和特定主题如何影响聊天机器人的准确性.
主要方法:
- 收集了2015-2020年土耳其国家医疗专业化考试的紧急医疗问题.
- 他们向ChatGPT-4,谷歌Gemini和微软Copilot提出了问题.
- 根据问题的长度,类型和主题分析错误率,包括创伤,手术方法,烧伤,儿科和"概率"术语.
主要成果:
- 微软Copilot以7.8%的误差率获得了最高的准确性,明显超过了谷歌Gemini (22.9%的误差率).
- 所有聊天机器人在与创伤和外科手术相关的问题,以及烧伤和儿科问题上的错误率都较高.
- 问题措辞,特别是使用"概率",影响了AI答案的准确性.
结论:
- 人工智能聊天机器人显示出作为医学学习和考试准备的补充工具的潜力.
- 尽管AI的准确性很有希望,但它不应该被认为是医学专业化考试的主要来源.
- 需要进一步的研究来完善AI在复杂的医疗问题领域的性能.


