两种人工智能模型在兽医课程的考试中表现不佳
Journal of the American Veterinary Medical Association
|February 21, 2024
概括
像ChatGPT这样的人工智能 (AI) 模型显示兽医科学知识的局限性. GPT-4.0的表现比GPT-3.5更好,但仍然比兽医学生得分更低,这表明建议谨慎使用.
科学领域:
- 兽医教育 兽医教育
- 教育中的人工智能
背景情况:
- 人工智能 (AI) 和大型语言模型 (LLM) 提供了新的教育可能性.
- 对于教育工作者和学生来说,了解AI在兽医学方面的知识至关重要.
- 聊天GPT平台 (GPT-3.5和GPT-4.0) 需要对其准确性和一致性进行评估.
研究的目的:
- 评估ChatGPT GPT-3.5和GPT-4.0.0的知识水平和响应一致性.
- 将AI模型的性能与兽医学生的知识进行比较.
主要方法:
- 使用了来自第三年兽医课程的495个多选题和真假问题.
- 在GPT-3.5和GPT-4.0中输入问题三次,记录答案.
- 将人工智能生成的答案与教师提供的正确答案进行比较.
主要成果:
- GPT-3.5实现了55%的性能; GPT-4.0实现了77%的性能.
- 这两个AI平台的得分明显低于兽医学生 (86%).
- 与GPT-3.5相比,GPT-4.0显著提高了性能 (P < .05).
结论:
- 像ChatGPT这样的当前人工智能模型显示兽医科学中的知识差距.
- 兽医教育工作者和学生在使用人工智能平台获取信息时应谨慎使用.
- 需要进一步的研究来提高AI在专业科学领域的准确性.


