评估网络检索辅助的大型语言模型,并没有白名单为基于证据的神经学:比较研究
Lars Masanneck1, Paula Zoe Epping1, Sven G Meuth1
1Department of Neurology, Medical Faculty and University Hospital Düsseldorf, Heinrich Heine University Düsseldorf, Dusseldorf, Germany.
Journal of medical Internet research
|October 29, 2025
概括
将大型语言模型 (LLM) 限制在权威来源上显著提高了检索医学证据的准确性. 这种有针对性的方法提高了基于证据的护理的可靠性,使LLM成为更值得信赖的决策支持工具.
科学领域:
- 人工智能在医学中的应用
- 自然语言处理自然语言处理.
- 生物医学信息学 生物医学信息学
背景情况:
- 具有网络检索的大型语言模型 (LLM) 正在成为医学证据的主要信息来源.
- 开放网络检索可能会导致非专业来源的实际错误和幻觉,可能会损害基于证据的护理.
- 确保LLM产生的医疗信息的准确性对于临床决策至关重要.
研究的目的:
- 评估将检索限制在指南领域 (白名单) 对公开可用的LLM的答案质量的影响.
- 将白名单LLM与专门的生物医学文献检索系统 (OpenEvidence) 的性能进行比较.
主要方法:
- 使用了来自美国神经病学会 (AAN) 准则的130项问题集.
- 通过开放式网络和白名单检索 (AAN/神经学领域) 查询了三个困惑的LLM.
- 盲目的神经病学家评估了答案的准确性,第三位专家解决了分歧.
主要成果:
- 在Perplexity模型中,白名单将正确答案率提高了8-18个百分点.
- 仅使用AAN/神经学来源的LLM与包括非专业来源在内的LLM相比,准确度更高的几率翻了一番.
- 事实问题得到的答案比Perplexity模型上的基于案例的问题更准确.
结论:
- 将LLM检索限制在权威域上显著提高了答案的正确性,并减少了变化.
- 这种源控制将消费者搜索助手转化为可靠的决策支持工具,与专业系统相当.
- 轻量级源控制是基于证据的神经学的基于网络的LLM的重要安全机制.


