聊天GPT回答了110个问题的实验室酶学学生考试:通过还是失败?
Berina Hasanefendic1,2, Aleksandra Pasic1,2, Selvedina Duskan1,2
1Clinical Biochemistry and Laboratory Medicine, Clinical Center University of Sarajevo, Sarajevo, BIH.
Cureus
|May 14, 2025
概括
这项研究评估了ChatGPT在实验室酶学方面的知识,发现其得分低于学生. 虽然ChatGPT-4.0的表现优于ChatGPT-3.5,但两者都与人类学生的表现不匹配,表明了教育的潜力,但不是教育的替代品.
科学领域:
- 生物化学 生物化学
- 医学教育 医学教育
- 人工智能的人工智能
背景情况:
- 人工智能的近期进展,特别是像ChatGPT这样的聊天机器人,激起了人们对它们在各种领域的应用的兴趣.
- 人工智能产生的答案的可靠性和准确性的担忧需要严格的评估,特别是在专门的科学领域.
- 实验室酶学是一个复杂的领域,人工智能知识评估对于教育融合至关重要.
研究的目的:
- 在实验室酶学中评估ChatGPT-3.5和ChatGPT-4.0的知识.
- 为了比较这些AI模型与同一个科目的人类学生的表现.
- 探索ChatGPT在高等教育和医学教育中对酶学的潜在实用性.
主要方法:
- 进行了一项包括110个问题在实验室酶学中的四个关键主题中的检查.
- 对52名学生和ChatGPT-3.5和ChatGPT-4.0.0两个学生的答案准确性进行了评估.
- 在学生和人工智能表现之间进行了比较分析,观察到总体合格率为60%.
主要成果:
- 学生的平均得分为85.46%,明显超过了ChatGPT-3.5 (52.73%) 和ChatGPT-4.0 (74.55%).
- 与ChatGPT-3.5.5相比,ChatGPT-4.0表现出更高的性能.
- 这两种AI版本都在与代谢中的酶相关的问题上表现出色,但在酶的实验室分析方面遇到了困难.
结论:
- 在实验室酶学中,ChatGPT表现平均,得分低于人类学生.
- 人工智能聊天机器人显示出在高等教育和医学教育中作为补充学习工具的潜力,这取决于显著的优化.
- 目前在这个专业领域的AI能力还不允许取代人类教育工作者或全面的学习资源.


