评估大型语言模型与人类研究人员在现实世界复杂的医学查询中的表现
Daphna Idan1, Itamar Ben-Shitrit2,3, Mark Volevich4
1Ben-Gurion Faculty of Health Sciences, Beer-Sheva, Israel. daphnaid@post.bgu.ac.il.
Scientific reports
|October 30, 2025
概括
大型语言模型 (LLM) 在生成可靠的临床报告方面还不能与人类研究人员相匹配. 医生满意度是报告质量的不可靠指标,突出了LLM能力的重大差距.
科学领域:
- 人工智能在医学中的应用
- 临床决策支持 临床决策支持
- 医疗信息学 医疗信息学
背景情况:
- 大型语言模型 (LLM) 在解决复杂的临床查询方面的有效性正在研究中.
- 医生对输出质量的评估经常用于评估医疗保健机构的LLM绩效.
研究的目的:
- 将领先的LLM (GPT-4o,Gemini 2.0,Claude Sonnet 3.5) 生成的临床报告的质量与人类撰写的报告进行比较.
- 确定医生满意度是否与报告质量的客观测量相关.
主要方法:
- 对三个LLM和人类研究人员提出了20个临床困境.
- 总共分析了56个LLM生成的报告和20个人类生成的报告.
- 所有报告都评估了客观的质量指标和医生满意度.
主要成果:
- 人类报告在满足预期,可靠性,专业写作和节省时间的潜力方面被评为更高.
- 人类报告引用了更多的来源,这些来源被认为更相关,尽管它们来自影响较小的期刊.
- 与人类报告不同,LLM报告包含了幻觉和不诚实的引用;医生满意度和客观质量之间没有发现相关性.
结论:
- 在产生可靠和相关的临床报告方面,在LLM能力和人类研究人员之间仍然存在很大的差距.
- 医生满意度是评估LLM产生的临床内容质量的不足指标.


