大型语言模型对脊髓损伤的反应:对表现的比较研究
Jinze Li1,2, Chao Chang1,2, Yanqiu Li3
1Department of Neurosurgery, Xuanwu Hospital, Capital Medical University, No. 45 Changchun Street, Xicheng District, Beijing, 100053, China.
Journal of medical systems
|March 25, 2025
概括
这项研究比较了四个大型语言模型 (LLM) 的脊髓损伤 (SCI) 信息. 聊天GPT提供了最准确的答案,而Gemini提供了最高质量的信息.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 神经学 神经学
背景情况:
- 脊髓损伤 (SCI) 在发病,治疗和康复方面存在复杂的挑战.
- 患者越来越多地在网上寻找有关SCI的医疗信息.
- 大型语言模型 (LLM) 在患者教育和临床决策支持方面显示出越来越大的潜力.
研究的目的:
- 系统地比较四个领先的LLM (ChatGPT-4o,Claude-3.5 Sonnet,Gemini-1.5 Pro,Llama-3.1) 在回答脊髓损伤相关问题的表现.
- 评估LLM生成的SCI.响应的质量,可读性,准确性和全面性.
- 评估LLM在被要求修改时的自我纠正能力.
主要方法:
- 四名LLM被查询了37个问题,涵盖SCI病变,危险因素,临床特征,诊断,治疗和预后.
- 使用"为患者提供质量信息" (EQIP) 工具评估了响应质量.
- 使用弗莱什-金凯德指标测量可读性.
- 三位高级脊椎外科医生使用共识评分来评估准确性.
主要成果:
- 双子-1.5 Pro获得了最高的EQIP分数,表明信息质量优越.
- 聊天GPT-4o显示了最高的准确性,83.8%的回复被评为"好".
- 所有的LLM通常表现出低可读性 (大学水平的理解),但有效地简化了复杂的信息.
- 在修改提示之后,LLM显示出显著的自我纠正能力,准确性得到了很大改善.
结论:
- 虽然Gemini-1.5 Pro在SCI的信息质量方面表现出色,但ChatGPT-4o提供了最准确和最全面的响应.
- 在SCI中,LLM显示出患者教育和临床决策支持的潜力,但准确性仍然是一个关键因素.
- 需要进一步的研究来优化LLM的性能,并确保可靠的医疗信息交付,如SCI.复杂的条件.


