基于大型语言模型的多代理合作,用于抽象选,以实现自动化系统审查.
Opeoluwa Akinseloyin1, Xiaorui Jiang2, Vasile Palade1
1Centre for Computational Science and Mathematical Modelling, Coventry University, Puma Way, Coventry, CV1 2TT, United Kingdom.
Biology methods & protocols
|March 4, 2026
概括
多个大型语言模型 (LLM) 的协作显著提高了系统审查抽象选效率. 多数投票成为首要策略,减少了高达68%的工作量,同时保持了高回忆率.
科学领域:
- 医疗保健中的人工智能
- 信息科学 信息科学 信息科学
- 生物医学信息学 生物医学信息学
背景情况:
- 系统性审查 (SRs) 对基于证据的实践至关重要,但耗时,特别是抽象选.
- 目前的抽象选方法是劳动密集型的,阻碍了研究证据的高效合成.
研究的目的:
- 评估多个大型语言模型 (多个LLM) 协作在提高系统审查抽象选效率和降低成本方面的有效性.
- 将不同的多LLM协作策略与基线问答 (QA) 方法进行比较.
主要方法:
- 抽象选是以质量保证任务为模式,使用具有成本效益的LLMs.
- 测试了三个多个LLM协作策略:多数投票,多个代理商辩论和基于LLM的裁决.
- 从CLEF eHealth 2019基准中对28个SR进行了绩效评估,使用了平均平均精度 (MAP) 和在采样中节省的工作 (WSS@95%) 等指标.
主要成果:
- 多LLM合作显著超过了个别质量保证基线.
- 多数投票实现了最高的MAP (0.462和0.341) 和WSS@95% (0.606和0.680),表明在95%的回忆中,潜在的工作量减少了高达68%.
- 多代理辩论对较弱的模型有好处,而基于LLM的裁决是有效的,但比投票或辩论更昂贵.
结论:
- 多LLM合作为系统审查的抽象选效率提供了实质性的改进,由模型多样性驱动.
- 多数投票提供了高性能和低成本的最佳平衡,使其成为领先的策略.
- 多个代理商的辩论仍然是一个具有成本效益的选择,也是未来技术辅助审查研究的一个有希望的领域.
更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
07:14Virtual Agent for Real-Time Motivational Interviewing by Integrating Adaptive Nonverbal Behavior and Language Models
Published on: December 23, 2025
