人工智能与临床判断:生成模型如何准确地反映中枢神经系统对奇亚里形的指导方针?
David Shin1, Hyunah Park1, Isabel Shaffrey2
1School of Medicine, Loma Linda University, Loma Linda, CA, USA.
Clinical neurology and neurosurgery
|November 29, 2024
概括
像Perplexity和Copilot这样的生成AI模型与Chiari 1形指南的一致性比ChatGPT和Gemini更高. 然而,所有AI的反应都是复杂的,不容易读取,这强调了需要临床医生的判断.
科学领域:
- 神经外科手术 神经外科手术
- 人工智能在医学中的应用
- 医学指导方针 医学指导方针
背景情况:
- 2023年神经外科医生大会 (CNS) 准则为Chiari 1形提供了关键建议.
- 生成型人工智能 (AI) 模型越来越多地被用于临床应用,需要对其准确性和实用性进行评估.
研究的目的:
- 评估领先的生成AI模型的准确性和可读性,以响应基于2023年中央神经系统指南的Chiari 1形问题的问题.
- 为了比较Perplexity,ChatGPT 4o,Microsoft Copilot和Google Gemini在提供符合指南的信息方面的表现.
主要方法:
- 从2023年中央神经系统指南中对奇亚里1形提出了13个问题.
- 对Perplexity,ChatGPT 4o,Copilot和Gemini的响应进行了评估,以确定它们是否符合指南.
- 非一致的反应被归类为不足或过于结论性的.
- 可读性是使用Flesch-Kincaid等级水平,炮雾指数,SMOG指数和Flesch阅读易度来评估的.
主要成果:
- 与Gemini (30.8%) 和ChatGPT 4o (23.1%) 相比,困惑 (69.2%) 和Copilot (61.5%) 的一致率更高.
- 聊天GPT 4o和Gemini表现出过于明确的反应率最高 (分别为76.9%和61.5%).
- 所有的人工智能模型都产生了高度复杂的响应,由高的Flesch-Kincaid,炮雾和SMOG得分以及低的Flesch阅读易度得分表明.
结论:
- 在指导方针对齐方面,Perplexity和Copilot在Chiari 1形方面表现最好.
- 在所有模型中,高程度的过度结论性反应和难以阅读性突出了直接临床应用的局限性.
- 由于准确性和可读性问题,当前的AI模型应该补充,而不是取代临床医生的判断,以管理Chiari 1形.


