评估ChatGPT-4和ChatGPT-4o作为牙周内科的学习工具的性能
Esra Arılı Öztürk1, Ceren Turan Gökduman1, Burhan Can Çanakçi1
1Department of Endodontics, Faculty of Dentistry, Trakya University, Edirne, Turkey.
International endodontic journal
|March 3, 2025
概括
与ChatGPT-4相比,ChatGPT-4o在内牙教育评估中表现出更高的准确性. 虽然一致性类似,但ChatGPT-4o
科学领域:
- 牙科教育中的人工智能
- 牙周内教育技术 牙周内教育技术
- 人工智能聊天机器人性能评估评估
背景情况:
- 人工智能 (AI) 在教育环境中的整合正在迅速扩大.
- 人工智能聊天机器人提供了潜在的学习和评估工具,在专业领域,如内科医生.
- 评估不同AI模型的性能对于其有效实施至关重要.
研究的目的:
- 为了比较ChatGPT-4和ChatGPT-4o响应的准确性和一致性.
- 评估AI在本科内学多选题上的表现.
- 为了确定问题主题和一天时间对AI准确性的影响.
主要方法:
- 使用了来自6个内牙科主题的60个多选题.
- 聊天GPT-4和聊天GPT-4o每天被查询3次,连续3天.
- 统计分析 (SPSS,R) 比较了准确度和一致率 (p < .05).
主要成果:
- 聊天GPT-4o的准确率 (92.8%) 比聊天GPT-4 (81.7%;p <.001) 高得多.
- 问题主题对两种AI模型的准确性产生了重大影响 (p < .001).
- 在ChatGPT-4和ChatGPT-4o之间一致率没有发现显著差异 (p = .123).
结论:
- 与ChatGPT-4相比,ChatGPT-4o对内学知识评估具有更高的准确性.
- 人工智能聊天机器人有望成为牙科教育中的补充工具.
- 仔细考虑人工智能的局限性和风险对于负责任的整合至关重要.


