聊天机器人健康咨询研究的大型语言模型:系统审查
Bright Huo1, Amy Boyle2, Nana Marfo3
1Division of General Surgery, Department of Surgery, McMaster University, Hamilton, Ontario, Canada.
JAMA network open
|February 4, 2025
概括
关于医疗保健中大语言模型 (LLM) 研究的报告质量不一致. 这一系统性审查强调了对标准化报告的需求,以确保在患者护理中安全有效地整合AI.
科学领域:
- 医疗信息学 医疗信息学
- 人工智能在医学中的应用
- 临床研究方法论 临床研究方法论
背景情况:
- 越来越多的人对将大型语言模型 (LLM) 集成到医疗保健环境中感兴趣.
- 现有的评估LLM健康咨询能力的研究往往缺乏一致的报告质量.
- 需要对人工智能驱动的健康工具制定标准化的评估框架.
研究的目的:
- 系统地审查同行评审的关于生成性AI聊天机器人的研究报告的变化,以提供健康建议.
- 识别报告中的差距,以告知聊天机器人评估报告工具 (CHART) 的开发.
主要方法:
- 在 MEDLINE,Embase 和 Web of Science 进行系统的文献搜索,截至 2023 年 10 月.
- 7752篇文章的标题/摘要和全文由两个独立审稿人选.
- 从137项符合条件的研究中提取数据,评估人工智能聊天机器人的临床准确性.
主要成果:
- 包括的研究涵盖了手术,医学和初级保健,重点是治疗,诊断和预防.
- 大多数研究都评估了封闭源代码的LLM,没有指定版本或关键特征 (例如温度,令牌长度).
- 报告中缺乏有关快速工程,LLM查询日期和客观绩效指标的细节;伦理和安全影响很少得到解决.
结论:
- 关于人工智能聊天机器人用于健康咨询的研究报告质量异质.
- 调查结果强调需要标准化报告准则,如CHART,以确保可靠的评估.
- 解决伦理,监管和患者安全方面的问题对于临床LLM整合至关重要.


