人工智能如何与Delphi环境中的专家相比:用大型语言模型模拟医疗共识
Young Suk Park1,2, Dongjae Jeon1, Songchang Shi2,3
1Department of Surgery, Seoul National University Bundang Hospital, Seongnam-si, Seoul National University College of Medicine, Seoul, Republic of Korea.
International journal of surgery (London, England)
|October 15, 2025
概括
大型语言模型 (LLM) 在修改后的Delphi研究中比人类专家取得了更高的共识. 他们的集体智力与人类专家的决定密切相匹配,显示出医学共识建设的前景.
科学领域:
- 人工智能的人工智能
- 医疗信息学 医疗信息学
- 集体情报是一种集体情报.
背景情况:
- 大型语言模型 (LLM) 显示了通过模拟辩论和协作来增强决策的潜力.
- 关于LLM集体智能是否可以复制人类专家共识的研究有限.
研究的目的:
- 通过使用修改后的Delphi方法,研究LLM之间建立共识的过程和结果.
- 将LLM共识结果与来自人类专家的Delphi研究结果进行比较.
主要方法:
- 一项涉及8名LLM的三轮Delphi研究评估了135份医疗陈述.
- LLM独立评估陈述,通过反精制意见,并参与双重辩论.
- 共识被定义为≥70%的协议;一致性测量了LLM和人类专家之间的相同结果.
主要成果:
- 在总体上,LLM的共识率 (93.3%) 比人类专家 (81.5%) 高.
- LLM与人类专家共识之间的一致性很高 (总体为78.5%,人类同意的陈述为91.8%).
- 各个LLM的改变决策的可能性和说服能力存在显著差异.
结论:
- 基于LLM的Delphi方法显示出高度的临床共识,与人类专家的决定密切一致.
- 实际上,LLM模拟了深思熟虑的推理,但采取了更保守的,指导方针驱动的立场.
- 需要进一步研究参数优化,以便在医学共识建设中实现LLM可重现性.


