聊天生成预训练变压器 (ChatGPT) 和巴德:人工智能尚未为部和膝盖关节炎提供临床支持的答案
JaeWon Yang1, Kyle S Ardavanis2, Katherine E Slack3
1Department of Orthopaedic Surgery, University of Washington, Seattle, Washington.
The Journal of arthroplasty
|January 18, 2024
概括
像ChatGPT和Bard这样的大型语言模型 (LLM) 不总是与骨关节炎治疗的医疗指南保持一致. 医生和患者应谨慎使用人工智能生成的医疗信息.
科学领域:
- 人工智能在医学中的应用
- 整形外科手术 整形外科手术
- 数字健康数字健康
背景情况:
- 大型语言模型 (LLM) 分析用户查询的在线数据.
- 对医学问题的LLM答案的准确性在很大程度上是未知的.
- 这项研究评估了骨关节炎治疗建议的LLM准确性.
研究的目的:
- 为了比较ChatGPT和Bard对部和膝盖骨关节炎治疗的反应.
- 评估与美国骨科外科医生学会 (AAOS) 临床实践指南 (CPGs) 的一致性.
主要方法:
- 聊天GPT和巴德询问了20种AAOS CPG治疗关节炎的治疗方法.
- 响应被分类为一致,不一致或不一致.
- 评价者之间的可靠性与科恩的卡帕评估;与LLM进行比较.
主要成果:
- 聊天GPT (80%) 和巴德 (60%) 与AAOS CPGs显示一致.
- 在30% (ChatGPT) 和60% (Bard) 的查询中,LLM鼓励使用非推的治疗方法.
- 巴德引用了30%的回答中的研究,但大多数是无法核实或不存在的.
结论:
- 聊天GPT和Bard并不总是与AAOS CPGs对骨关节炎治疗的一致.
- 人工智能平台目前为医疗决策提供了不可靠的指导.
- 医生和患者应对人工智能生成的医疗信息保持谨慎.


