利用人工智能和聊天生成器预训练的变压器来回答关于神经麻醉学临床场景的问题
Samuel N Blacker1, Mia Kang1, Indranil Chakraborty2
1Department of Anesthesiology, University of North Carolina at Chapel Hill.
Journal of neurosurgical anesthesiology
|December 21, 2023
概括
人工智能聊天机器人ChatGPT在回答临床指南问题方面表现出有限的可靠性. 有针对性的问题提高了准确性,但ChatGPT还不适合临床决策.
科学领域:
- 神经科学是一个神经科学.
- 人工智能的人工智能
- 临床指南 临床指南
背景情况:
- 临床指南对于基于证据的医学实践至关重要.
- 像ChatGPT这样的人工智能 (AI) 聊天机器人越来越多地用于信息检索.
- 人工智能的可靠性在提供准确的临床信息方面越来越令人担忧.
研究的目的:
- 根据麻醉学和重症监护神经科学学会 (SNACC) 临床指南,评估ChatGPT在回答问题的准确性.
- 评估ChatGPT将SNACC关于中风和脊柱手术指南中的高质量建议 (HQR) 纳入其能力.
- 识别ChatGPT提供的潜在的不准确或有害的建议.
主要方法:
- 四位神经麻醉学家独立审查了来自三条SNACC指南的52个HQR的ChatGPT反应.
- 评估包括HQR的存在,不正确的引用和遵守指南.
- 分析了ChatGPT对通用和有针对性的问题的反应.
主要成果:
- 审查员对HQRs的共识差异很大 (0%100%).
- 只有8%的HQR在通用问题后被一致识别;在针对性问题后,这一数字上升到44%.
- 发现了潜在的有害建议,ChatGPT没有引用SNACC指南.
结论:
- 聊天GPT的响应需要人类解释,并且对于HQR来说并不总是准确.
- 即使通过有针对性的询问,也只有不到50%的HQR可靠地被确定.
- 由于可靠性问题,目前不建议使用像ChatGPT这样的AI聊天机器人进行临床决策.
更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
225
08:11Surgical Training for the Implantation of Neocortical Microelectrode Arrays Using a Formaldehyde-fixed Human Cadaver Model
Published on: November 19, 2017
11.4K
