聊天GPT与NASS临床指南对退行性脊髓疏松症:一个比较分析
Wasil Ahmed1, Michael Saturno1, Rami Rajjoub1
1Icahn School of Medicine at Mount Sinai, New York, NY, USA.
概括
聊天GPT在提供退行性脊髓疏松症的临床建议方面显示出可变的准确性,在某些领域与指导方针保持一致,但在其他领域过于明确或不准确. 临床医生在咨询人工智能工具以获得医疗建议时必须谨慎.
科学领域:
- 人工智能在医学中的应用
- 脊柱外科手术 脊柱外科手术
- 临床决策支持 临床决策支持
背景情况:
- 临床指导方针有助于外科医生的决策,人工智能和大型语言模型 (LLM) 在医疗保健中显示出潜力.
- OpenAI的ChatGPT可以合成医学文献,为脊柱护理的临床决策提供了一个潜在的工具.
- 关于ChatGPT对退行性脊髓缩症临床决策支持的实用性存在有限的研究.
研究的目的:
- 为了比较ChatGPT的建议与北美脊柱协会 (NASS) 关于退行性脊髓缩的指南.
- 在当前医学文献的背景下评估ChatGPT的准确性.
主要方法:
- 聊天GPT-3.5和4.0被引发了来自NASS关于退行性脊髓缩症指南的问题.
- 答案被评为与NASS建议"一致"或"不一致".
- 不一致的反应进一步被归类为"不足"或"过于明确";GPT-3.5和4.0的结果使用奇二测试进行了比较.
主要成果:
- 聊天GPT-3.5与NASS指南达成46.4%的一致性,在定义的建议 (66.7%) 和未定义的领域 (36.8%) 上的准确性更高.
- 聊天GPT-4.0表现出67.9%的改进一致性,定义 (66.7%) 和未定义 (68.4%) 建议的性能相似.
- 来自ChatGPT-3.5的非一致反应主要是"过于明确" (80%).
结论:
- 像ChatGPT这样的LLM在临床环境中具有实用性和不准确性的二元性.
- 聊天GPT通常与NASS建议一致,证据很清楚,但在缺乏定义的最佳实践的领域扎.
- 临床医生必须谨慎,检查人工智能产生的建议与当前文献,因为潜在的不准确性和伪造的信息.


