在临床咨询中对生成人工智能聊天机器人进行人类评估的协议
Edwin Kwan-Yeung Chiu1, Tom Wai-Hin Chung1
1Department of Microbiology, Li Ka Shing Faculty of Medicine, The University of Hong Kong, Hong Kong, China.
PloS one
|March 19, 2025
概括
这项研究评估了用于临床咨询的生成人工智能 (GenAI) 聊天机器人. 一个标准化的协议评估AI模型的建议,指导安全有效的医疗保健实施.
科学领域:
- 人工智能在医学中的应用
- 临床信息学 临床信息学
- 医疗保健技术 技术 医疗保健 技术
背景情况:
- 生成型人工智能 (GenAI) 在医疗保健领域提供了变革性的潜力.
- 现实世界的临床实践需要严格的,基于证据的AI部署,以确保安全性和有效性.
研究的目的:
- 系统地评估大型语言模型 (LLM) 作为临床微生物学和传染病中的GenAI聊天机器人.
- 批判性地评估来自领先的GenAI模型如Claude 2,Gemini Pro和GPT-4.0.0的建议.
主要方法:
- 开发一种标准化的,针对医疗保健的提示模板,用于引发临床AI反应.
- 临床医师小组对人工智能产生的建议进行评估,使用5分利克特级别.
- 通过事实一致性,全面性,连贯性和医疗有害性进行评估.
主要成果:
- 该研究协议为评估临床环境中的GenAI聊天机器人提供了一个框架.
- 在商中将产生对GenAI可行性,局限性和边界的见解.
- 数据将为未来的研究和AI在医疗保健中的临床实施提供信息.
结论:
- 在临床实践中评估GenAI的标准化评估协议至关重要.
- 临床医生领导的评估对于确保人工智能工具的安全性和有效性至关重要.
- 制定伦理准则和安全防护措施对于患者安全和临床标准至关重要.


