一个大型语言模型对头手术中方法报告的评估
1Maxillofacial Oncology and Reconstructive Surgery, Department of Oral and Maxillofacial surgery, Boston Medical Center, Boston, MA, USA.
American journal of otolaryngology
|December 16, 2023
概括
聊天GPT 3.5可以有效地评估头部和部研究的科学方法. 这种大型语言模型 (LLM) 提供了一个可行的方法来评估学术写作中的研究质量.
科学领域:
- 医学研究方法论医学研究方法论.
- 人工智能在科学评估中的作用
- 头部和部瘤学文献文学
背景情况:
- 评估科学方法报告的质量对于研究完整性至关重要.
- 头部和部科学文献需要对研究方法进行强有力的评估.
- 大型语言模型 (LLM) 为自动化科学内容分析提供了潜在的工具.
研究的目的:
- 评估ChatGPT 3.5在评估科学方法报告质量的能力.
- 通过LLM评估头部和部科学文献中的方法部分的报告质量.
主要方法:
- 聊天GPT 3.5被要求开发一个研究方法的评分系统 (最多60分).
- 该系统包括研究设计,数据收集,统计分析,道德考虑和清晰度等分数.
- 从AHNS奖学金课程中随机选择的20篇文章被通过ChatGPT 3.5.5分析.
主要成果:
- 大多数被评估的文章 (8/20非常好,9/20好) 获得了高累积分.
- 统计分析报告获得了最低的平均得分 (0.49 ± 0.02).
- 在分数类别 (ANOVA,p ≤0.05) 之间发现了显著的差异,数据收集和统计分析分数较低.
结论:
- 聊天GPT 3.5 在评估头部和部研究的方法学部分的可行性.
- 法律法规可以作为一种可行的工具来评估科学方法报告的质量.
- 进一步的研究可以完善科学文献评估中的LLM应用.


