对以患者为导向的神经干预查询的大型语言模型反应:对准确性,完整性,安全性和可操作性的多级评估
Albert Hw Jiang1, Tyler R Ray2,3, Alisha E Suri1
1John A. Burns School of Medicine, University of Hawai'i at Mānoa, Honolulu, HI, USA.
概括
大型语言模型 (LLM) 为神经干预查询提供了医疗安全但往往不完整的信息. 面向患者的人工智能工具需要仔细评估,考虑专家和普通人的观点,以安全地融入医疗保健.
科学领域:
- 医疗信息学 医疗信息学
- 人工智能在医学中的应用
- 神经干预放射学神经干预放射学
背景情况:
- 公众越来越多地使用大型语言模型 (LLM) 来提供医疗信息.
- 关于LLM产生的医疗建议的安全性,完整性和可靠性的不确定性,特别是在专业领域.
- 需要在面向患者的临床环境中对LLM进行评估.
研究的目的:
- 评估LLM对神经干预患者查询的答案的准确性,完整性,安全性和可操作性.
- 为了比较五个领先的法学士在专业医疗领域的表现.
- 调查评价者专业知识 (医生与非医生) 对LLM输出评估的影响.
主要方法:
- 五位LLM (ChatGPT,Gemini,Claude,Perplexity,DeepSeek) 被提示提出了四个神经干预临床问题.
- 每个LLM在每个问题上被查询了三次,以确保响应的可变性.
- 八名盲目评价者 (医生和非医生) 使用利克特尺度对准确性,完整性,安全性和可操作性进行了评价,并进行了窃分析.
主要成果:
- 在准确性,完整性和可操作性方面,DeepSeek表现出卓越的性能.
- 双子座的抄袭率较高,整体表现较差.
- 医生比非医生更为关键,除了可操作性,非医生评价较低. 一般来说,LLM获得了很高的安全评分.
结论:
- 目前的LLM提供医疗安全但往往不准确或不完整的信息,以患者为导向的神经干预问题.
- 在专家评估的同时,将外界的观点与专家评估相结合,对于了解患者对人工智能产生的医疗内容的解释至关重要.
- 负责任的临床实施和患者教育对于在医疗保健中扩大LLM的使用至关重要.


