模范学生:GPT-4在研究生生物医学科学考试中的表现
Daniel Stribling1,2,3, Yuxing Xia4,5, Maha K Amer6
1Department of Molecular Genetics and Microbiology, University of Florida, Gainesville, FL, 32610, USA. ds@ufl.edu.
Scientific reports
|March 7, 2024
概括
像GPT-4这样的大型语言模型在生物医学科学考试中表现强,在许多方面超过学生. 然而,数字处理的局限性和潜在的抄袭需要仔细考虑学术用途.
科学领域:
- 生物医学科学 生物医学科学
- 人工智能的人工智能
- 教育技术的教育技术
背景情况:
- 像GPT-4和ChatGPT这样的大型语言模型 (LLM) 越来越能够成为文本生成器.
- GPT-4已经在标准化测试中表现出熟练,但其在各种知识领域的可靠性需要评估.
- 在生物医学科学等专业领域评估人工智能性能对于理解其潜力和局限性至关重要.
研究的目的:
- 评估GPT-4大型语言模型在研究生级生物医学科学考试中的性能和准确性.
- 为了确定特定的问题格式和内容类型,GPT-4在哪里优秀或扎.
- 在先进的人工智能工具的背景下,为未来的学术评估设计提供信息.
主要方法:
- GPT-4在九个研究生级生物医学科学考试中进行了测试,其中七个是盲目的.
- 在不同类型的问题上分析了表现:空白填写,简短答案,论文和涉及数字的问题.
- 对答案的准确性,抄袭和幻觉的情况进行了评估.
主要成果:
- 在九项考试中,GPT-4在七项考试中超过了学生的平均得分,并在四项考试中超过了所有学生的得分.
- 该模型在基于文本的问题和使用已出版手稿中的数字的问题上表现良好.
- 在含有模拟数据的数字和需要手绘答案的问题上观察到表现不佳. 在一些回复中,注意到抄袭和幻觉.
结论:
- GPT-4在回答研究生级生物医学科学问题方面表现出显著的能力,通常表现优于人类学生.
- 该模型的局限性,特别是视觉数据和产生不准确或抄袭内容的可能性,凸显了需要仔细整合到学术环境中的必要性.
- 未来的学术评估可能需要进行调整,以考虑人工智能的能力,并减轻潜在的滥用.


