评估ChatGPT在科学研究中模仿人类审稿人的能力:一种描述性和定性方法

Aiman Suleiman1, Dario von Wedel2, Ricardo Munoz-Acuna2

  • 1Department of Anesthesia, Critical Care and Pain Medicine, Harvard Medical School, Beth Israel Deaconess Medical Center, Boston, MA, USA; Center for Anesthesia Research Excellence (CARE), Harvard Medical School, Beth Israel Deaconess Medical Center, Boston, MA, USA; Department of Anesthesia, Critical Care and Pain Medicine, Albert Einstein College of Medicine, Montefiore Medical Center, Bronx, NY, USA.

概括

聊天GPT (生成预训练变压器) 在科学同行评审中表现出有限的能力,以模仿人类评审者. 这种人工智能工具与大多数人类的评论不一致,这表明它还不是在评估研究中可靠的替代人类专业知识.