目前可用的大型语言模型没有提供与基于证据的临床实践指南一致的肌肉骨治疗建议
Benedict U Nwachukwu1, Nathan H Varady1, Answorth A Allen1
1Department of Orthopaedic Surgery, Hospital for Special Surgery, New York, New York, U.S.A.
概括
领先的大型语言模型 (LLM) 经常为旋转手腕和ACL损伤提供治疗建议,这些建议与临床实践指南不一致. 需要进一步的研究来确保LLM在医疗保健中的可信度.
科学领域:
- 整形外科手术 整形外科手术
- 人工智能在医学中的应用
- 临床实践指南 临床实践指南
背景情况:
- 大型语言模型 (LLM) 越来越多地用于医疗信息检索.
- 评估LLM建议与基于证据的临床实践指南 (CPG) 的一致性对于患者安全至关重要.
- 美国骨科外科医生学会 (AAOS) 为常见的骨科疾病开发了CPG.
研究的目的:
- 评估领先的LLM与AAOS CPG对旋转手套撕裂和前十字带 (ACL) 损伤的治疗建议的准确性.
- 为了比较不同LLM的一致率,包括ChatGPT-4,Gemini,Mistral-7B和Claude-3.
主要方法:
- 提取的AAOS CPG用于旋转手套撕裂 (n=33) 和ACL损伤 (n=15).
- 收集了四个LLM的治疗建议:ChatGPT-4,Gemini,Mistral-7B和Claude-3. 这四个LLM的治疗建议是:ChatGPT-4,Gemini,Mistral-7B和Claude-3.
- 两个失明的医生评估了LLM建议与AAOS CPGs (一致,不一致,不确定) 的一致性,并分析了透明度.
主要成果:
- 与AAOS CPGs的总体一致性为70.3%,不确定性为22.4%,不一致性为7.3%.
- 聊天GPT-4表现出最高的一致性 (79.2%),而Mistral-7B表现出最不确定的反应 (35.4%).
- 双子座显示出最多不一致的建议率 (12.5%),只有10.4%的LLM回复是透明的,有可验证的参考.
结论:
- 对旋转手腕和ACL伤害的LLM建议中有很大一部分与当前基于证据的CPG不一致.
- 虽然ChatGPT-4表现最好,但观察到的错误率和缺乏透明度表明,LLM还不是完全值得信赖的临床支持工具.
- 对多个LLM进行比较评估是必要的,以避免偏见,并了解个别模型的优缺点.
更多相关视频
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
525
06:28Biomechanical Changes Related to Low Back Pain: An Innovative Tool for Movement Pattern Assessment and Treatment Evaluation in Rehabilitation
Published on: December 13, 2024
452
