人工智能大型语言模型 (Copilot和Gemini) 的表现与卫生保健政策制定中的人类专家相比:一项混合方法横截面研究
Mohsen Khosravi1, Reyhane Izadi2, Mina Aghamaleki Sarvestani2
1Social Determinants of Health Research Center, Birjand University of Medical Sciences, Birjand, Iran.
Health informatics journal
|September 22, 2025
概括
人工智能 (AI) 大型语言模型 (LLM) 在医疗保健政策制定任务中表现优于人类专家. 人工智能显示出作为加强政策制定的协作工具的巨大潜力.
科学领域:
- 医疗保健政策 医疗保健政策
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 医疗保健政策制定需要复杂的决策.
- 对人类专家进行AI性能评估对于采用至关重要.
- 大型语言模型 (LLM) 是各种专业领域的新兴工具.
研究的目的:
- 为了比较人工智能大型语言模型 (LLM) 与医疗保健政策制定中的人类专家的性能.
- 评估人工智能的准确性,敏感性和特异性以及人类对政策相关问题的反应.
主要方法:
- 在伊朗 (2024-2025) 进行的一项混合方法横截面研究.
- 比较了Bing AI Copilot,Gemini和15名人类专家的反应.
- 使用了含有参数的混矩阵分析,包括灵敏度,特异性,PPV,NPV和精度.
主要成果:
- 与人类专家相比,人工智能LLM表现优越.
- 副驾驶员实现了0.65的准确性,双子座0.65和人类专家0.5050.0.
- 人工智能模型在政策相关问题的答案中显示出更高的灵敏度和积极的预测值.
结论:
- 在这个医疗保健政策制定评估中,AI LLMs显著超过了人类专家.
- 在政策制定方面,LLM具有相当大的潜力,可以增强和与人类专家合作.
- 人工智能可以在医疗保健政策领域作为有价值的补充工具.
更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
1.3K
07:08Estimate the Cognitive Load Using Electrocardiographic Measure: A Human-AI Collaborative Task
Published on: December 5, 2025
190
