评估用于耳鼻喉科和头手术早期文章识别的大型语言模型 系统性审查
Ajibola B Bakare1, Young Lee2, Jhuree Hong3
1Tulane University School of Medicine New Orleans Louisiana USA.
Health care science
|March 2, 2026
概括
像ChatGPT和Bard这样的大型语言模型显示出识别耳鼻喉科系统评论中的最近文章的潜力,但目前不准确性需要人类监督.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 耳鼻喉科研究 耳鼻喉科研究
背景情况:
- 系统的文献审查在耳鼻喉科 - 头部和部手术中至关重要.
- 最初的物品识别是一个关键和耗时的步骤.
- 先进的人工智能工具的出现需要评估它们在研究方法中的作用.
研究的目的:
- 在系统性审查的初始文章识别阶段评估ChatGPT和Bard的有效性.
- 将ChatGPT和Bard的性能与已建立的系统审查协议进行比较.
- 确定人工智能生成的文章列表的准确性和回忆.
主要方法:
- 使用ChatGPTv3.5和Bard.复制了基于PRISMA的三个系统审查.
- 人工智能产生的成果 (作者,标题,年份,期刊) 与原始参考资料的比较.
- 与医疗数据库交叉引用AI输出,以验证真实性和测量回忆.
主要成果:
- 巴德在一些评论中显示出更高的回忆力和更广泛的日期范围.
- 在另一项审查中,ChatGPT-2显示了更高的回忆率和更真实的输出.
- 两种AI模型都产生了不准确性,但识别了手动搜索遗漏的相关文章.
结论:
- 大型语言模型 (LLM) 目前未能完全复制系统审查方法.
- 在识别相关的,特别是最近的文献方面,LLM显示出前景.
- 人为主导的系统审查仍然是黄金标准,但人工智能改进具有未来的潜力.


