大型语言模型可以完全自动化或部分协助系统审查中的论文选择吗?
Haichao Chen1, Zehua Jiang1, Xinyu Liu2
1Tsinghua Medicine, Tsinghua University, Beijing, China.
The British journal of ophthalmology
|January 15, 2025
概括
大型语言模型 (LLM) 显示了学术研究效率的前景. 然而,当前的LLM全自动化系统审查与纸张识别有困难,而LLM半自动化方法则显示出作为辅助工具的潜力.
科学领域:
- 医疗信息学 医疗信息学
- 研究中的人工智能.
- 基于证据的医学基于证据的医学.
背景情况:
- 大型语言模型 (LLM) 提供了简化学术研究过程的潜力.
- 在系统审查中LLM的有效性是证据综合的关键组成部分,需要进行详细的调查.
研究的目的:
- 评估两种基于LLM的系统审查方法的准确性和性能.
- 在识别相关研究论文时,将全自动化的LLM方法与半自动化的LLM方法进行比较.
主要方法:
- 开发了两种LLM方法:LLM完全自动化 (LLM-FA) 使用GPT-4插件和LLM半自动化 (LLM-SA) 通过GPT-4 API.
- 这些方法与三份已发表的关于糖尿病视网膜病变患病率的系统综述进行了比较.
主要成果:
- 在LLM-FA方法中,准确度较低:共识GPT (32.7%),学者GPT (19.4%),和GPT网页浏览 (6.1%).
- 通过LLM-SA方法实现了更高的绩效,正确包括了82.7%的相关论文,并排除了92.2%的无关论文.
结论:
- 目前的LLM还不足以在系统性审查中完全自主选择论文.
- 在LLM的半自动化方法显示显著的希望作为辅助工具,以提高系统审查的效率.


