大型语言模型生成和发表的外科手术期神经认知障碍建议的比较:一个横截面基于网络的分析
Sarah Saxena1, Odmara L Barreto Chang2, Melanie Suppan3
1Department of Surgery, Research Institute for Health Sciences and Technology, University of Mons, Mons, Belgium; Department of Anesthesiology, Helora, Mons, Belgium.
British journal of anaesthesia
|February 8, 2025
概括
像ChatGPT-4和Gemini这样的大型语言模型可以为手术前神经认知障碍 (PND) 产生可靠的建议,与现有的患者护理指南密切结合.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
背景情况:
- 术后神经认知障碍 (PND) 是手术后和麻醉后的常见并发症,特别是在老年人中.
- PNDs有助于增加患者的发病率,死亡率和医疗保健费用.
- 已经确立了PND预防和管理的指导方针.
研究的目的:
- 评估大型语言模型 (LLM) 在生成 PND 管理建议中的可靠性.
- 将人工智能生成的建议与已发表的临床指南进行比较.
主要方法:
- 在2024年6月进行了基于网络的在线横截面分析.
- 聊天GPT-4和Gemini被要求为PNDs生成护理包的表格.
- 人工智能生成的表格由独立审查员使用总分歧得分 (TDS) 和QAMAI进行评估.
主要成果:
- 聊天GPT-4和Gemini在TDS和QAMAI分数方面都产生了可比的结果.
- 人工智能产生的建议与已公布的PND指南保持良好一致.
- 没有一个人工智能模型完全符合指导方针;缺少引用来源.
结论:
- LLM显示出产生与临床指导方针一致的PND建议的潜力.
- 在人工智能产生的建议在临床上得到广泛采用之前,需要进一步的验证和临床医生的意见.


