在传染病教育中评估人工智能的表现:对ChatGPT,Google Bard,Perplexity AI,Microsoft Copilot和Meta AI进行比较分析
Abdulaziz Ibrahim Alzarea1, Azfar Athar Ishaqui2, Muhammad Bilal Maqsood3
1Department of Clinical Pharmacy, College of Pharmacy, Jouf University, Sakaka, Al-Jouf, Saudi Arabia.
Frontiers in medicine
|October 29, 2025
概括
这项研究将AI模型与传染病问题进行了比较. 聊天GPT 3.5是最准确的,但人工智能工具在准确的药物治疗建议方面扎.
科学领域:
- 医学教育 医学教育
- 人工智能的人工智能
- 传染性疾病 传染性疾病
背景情况:
- 在医学教育中对人工智能的性能进行比较分析.
- 评估人工智能工具用于传染病知识评估.
研究的目的:
- 系统地比较领先的人工智能平台在回答传染病多选题时的准确性和一致性.
- 确定人工智能在传染病的诊断和治疗推理中的优缺点.
主要方法:
- 利用了20个传染病病例研究,包括160个多项选择题.
- 标准化的提示被用于查询ChatGPT 3.5,谷歌巴德 (双子座),困惑AI,微软Copilot和MetaAI.
- 答案与参考答案密钥进行了评估,测量了24小时的准确性和一致性.
主要成果:
- 聊天GPT 3.5 获得了最高的准确性 (65.6%),在症状识别方面表现出色,但在抗菌治疗建议方面表现不佳.
- 人工智能模型在症状识别方面表现最好 (76.5%),在治疗相关问题方面表现最差 (57.1%).
- 微软Copilot展示了最稳定的反应,而人工智能生成的抗菌疗法建议随着时间的推移而变化.
结论:
- 人工智能平台对传染病教育有前途,但在药物治疗决策方面存在局限性.
- 在AI的抗菌选择,剂量准确性和临床应用的反应稳定性方面需要改进.
- 进一步的研究,包括临床试验,对于增强人工智能驱动的医疗决策支持系统至关重要.
