如何评估人工智能助理的临床能力?
1Oxford University Clinical Academic Graduate School, University of Oxford, Oxford, United Kingdom.
Journal of medical Internet research
|December 5, 2023
概括
大型语言模型 (LLM) 在医疗保健方面具有很大的前景,在医学检查和患者查询方面表现出色. 严格的证据,如随机试验,是需要在广泛的临床部署AI在医学.
科学领域:
- 人工智能的人工智能
- 临床信息学 临床信息学
- 医疗人工智能 医疗人工智能
背景情况:
- 大型语言模型 (LLM) 在临床环境中展示了先进的能力,在医学知识测试和患者沟通方面超过了人类的表现.
- 尽管取得了令人印象深刻的成果,但LLM在日常医疗保健实践中的整合尚未确立,这引发了对验证要求的质疑.
- 目前的验证研究通常依赖于代用变量,突出显示在临床采用之前需要更强有力的证据.
研究的目的:
- 讨论在传统医疗保健环境中部署大型语言模型 (LLM) 所需的证据.
- 强调需要提高医疗领域的人工智能 (AI) 研究的严谨性.
- 探索LLMs的潜力,以提高患者护理和奖励创新.
主要方法:
- 这个观点综合了当前的研究,并讨论了LLM在临床环境中的表现的影响.
- 它强调了医疗保健中AI现有的验证方法的局限性.
- 它倡导未来的随机对照试验,以确定临床效用和安全性.
主要成果:
- 与医生相比,LLM在医疗检查中达到专家水平的表现,并在患者查询响应中表现出卓越的准确性和相关性.
- 与LLM在医疗保健中的部署相关的潜在风险和挑战并不能完全预测.
- 在LLMs的证明能力和其安全有效地融入临床工作流程所需的证据之间存在着公认的差距.
结论:
- 在医疗保健中LLMs的变革潜力需要更高标准的临床部署的研究证据.
- 未来的随机对照试验可能对于验证使用LLM进行临床咨询和协助至关重要.
- 加强人工智能研究的严谨性将确保LLM的创新转化为对患者的切实利益.


