提高证据综合效率:利用大型语言模型和代理工作流来优化文学选
Bing Hu1,2,3, Emmalie Tomini1, Tricia Corrin4
1Data Management, Innovation and Analytics, Data, Surveillance and Foresight, Public Health Agency of Canada Ottawa Ontario Canada.
Cochrane evidence synthesis and methods
|October 23, 2025
概括
人工智能管道GREP-Agent通过整合大型语言模型和人类反来增强对公共卫生的证据选. 该系统可提高关键健康数据的准确性和效率.
科学领域:
- 公共卫生 公共卫生
- 流行病学 流行病学
- 人工智能的人工智能
背景情况:
- 全球公共卫生事件需要可访问,最新的证据,通过可持续的过程来策划.
- 全球流行病学参数存储库 (grEPI) 计划探索人工智能辅助的证据选管道.
- 大型语言模型 (LLM) 的进步被利用为有效的证据策划.
研究的目的:
- 评估GREP-Agent的性能,这是一个代理-AI辅助管道,用于选流行病学证据.
- 评估LLM和人类反对证据选的准确性和效率的影响.
- 在公共卫生背景下测量GREP-Agent框架的有效性.
主要方法:
- 该GREP-Agent在麻疹系统审查中的2000个引用上进行了测试.
- 四个LLM (GPT4o,GPT4o-mini,Llama3.1,Phi4) 被整合到GREP-Agent框架中.
- 使用准确度,精度,回忆和F1得分来测量性能,并使用人类反进行微调.
主要成果:
- 在GREP-Agent系统的每个阶段,在不同的LLM中都显示了渐进的准确性改进.
- 在微调后,GREP-Agent对84.2%-88.9%的灵敏度增加,在工作量减少策略下,灵敏度增加了86.4%-95.3%.
- 选问题的清晰度和值设置显著影响了业绩.
结论:
- 在公共卫生领域,GREP-Agent显示了提高证据综合效率的潜力.
- 可适应的人在循环的人工智能系统对于支持公共卫生响应至关重要.
- 进一步的发展应该优先考虑以人为中心的方法在AI驱动的文献选中.
相关概念视频
Improving Translational Accuracy
3.5K
3.5K
Improving Translational Accuracy
14.1K
Base complementarity between the three base pairs of mRNA codon and the tRNA anticodon is not a failsafe mechanism. Inaccuracies can range from a single mismatch to no correct base pairing at all. The free energy difference between the correct and nearly correct base pairs can be as small as 3 kcal/ mol. With complementarity being the only proofreading step, the estimated error frequency would be one wrong amino acid in every 100 amino acids incorporated. However, error frequencies observed in...
14.1K
Lagging Strand Synthesis
16.3K
16.3K


