基于大型语言模型的聊天机器人是否有效提供阿基里斯肌病的可靠医疗建议? 一个国际的多专业评估
Zuru Liang1, Ming Wang1, Nasef Mohamed Nasef Abdelatif2
1Department of Orthopaedics and Traumatology, The Chinese University of Hong Kong, Hong Kong, SAR, China.
Orthopaedic journal of sports medicine
|May 5, 2025
概括
大型语言模型 (LLM) 聊天机器人为健康信息提供了潜力,但它们对阿基里斯肌病症等特定疾病的可靠性需要仔细评估. 虽然ChatGPT 4.0提供了更出色的响应,但聊天机器人的整体可靠性各不相同.
科学领域:
- 人工智能在医学中的应用
- 整形外科手术 整形外科手术
- 数字健康数字健康
背景情况:
- 基于大型语言模型 (LLM) 的聊天机器人显示出对健康信息传播和患者教育的前景.
- 对于LLM聊天机器人提供针对特定疾病 (如阿基里斯肌病) 的医疗建议的可靠性,需要进一步调查.
- 现有的骨科研究对聊天机器人的可靠性提出了不同的发现,需要进行专注的检查.
研究的目的:
- 评估领先的基于LLM的聊天机器人关于阿基里斯肌病的答案的准确性和完整性.
- 评估ChatGPT 4.0,Claude 2和双子座提供信息的可靠性和质量.
主要方法:
- 采用了横截面研究设计.
- 基于阿基里斯肌病的荷兰临床指南,向ChatGPT 4.0,Claude 2和Gemini提出了18个问题.
- 答案由13名骨科专家使用4分评分系统进行评价,并计算了计算者间可靠性的类内相关系数.
主要成果:
- 在ChatGPT 4.0,Claude 2和Gemini的平均总分数中没有发现显著差异.
- 与Claude 2 (27.4%) 和Gemini (25.2%) 相比,ChatGPT 4.0显示出更高的优秀响应比例 (43.6%).
- 类内相关系数表明ChatGPT 4.0 (0.420) 的可靠性差,Claude 2 (0.522) 和Gemini (0.575) 的可靠性中等.
结论:
- 包括ChatGPT 4.0在内的LLM聊天机器人可以为阿基里斯肌病查询产生高质量的响应.
- 专家评估的不一致性和缺乏标准化的评估标准限制了最终的结论.
- 为将LLM聊天机器人整合到临床实践中,建议采取谨慎的标准化方法.


