从手动到机器:革命性的一天手术指南和共识质量评估与大型语言模型
Xingyu Wan1, Ruiyan Wang1, Junxian Zhao2
1The First School of Clinical Medicine, Lanzhou University, Lanzhou, China.
Journal of evidence-based medicine
|March 24, 2025
概括
门诊外科中心的临床实践指南要求提高质量. 大型语言模型 (LLM) 在协助质量评估方面表现有前途,补充手动评估以提高报告标准.
科学领域:
- 改善医疗保健质量 改善医疗保健质量
- 医学指导方针开发 医学指导方针开发
- 人工智能在医学中的应用
背景情况:
- 临床实践指南和专家共识文件对于门诊外科中心至关重要.
- 评估这些指南的方法和报告质量对于患者护理至关重要.
- 之前的质量评估依赖于手动评估,这可能耗费大量时间.
研究的目的:
- 评估自2000年以来出版的门诊外科手术中心指南的质量.
- 将手动评估与大型语言模型 (LLM) 分析进行质量评估.
- 探索LLMs在评估指南质量的可行性和附加值.
主要方法:
- 系统地搜索中文和英语数据库和指南存储库.
- 两个研究人员进行独立的文献选和数据提取.
- 通过手动评估和GPT-4o建模,使用AGREE II和RIGHT工具进行质量评估.
主要成果:
- 评估了54条指导方针,显示在AGREE II和RIGHT领域的平均合规性很低.
- 通过LLM评估的文档得分明显高于手动评估的文档.
- 更高的质量与证据检索,冲突披露,资金和LLM整合有关.
结论:
- 目前的门诊外科手术指南需要在方法和报告方面进行改进.
- 在质量评估中,LLM提供了额外的价值,验证了它们与手工方法一起使用.
- 手动评估仍然是基本的,LLMs作为一个有价值的补充.


