评估ChatGPT和DeepSeek在疼痛后的头痛管理中:与国际共识指南进行比较研究
Jiayi Deng1,2, Xu Qiu1,2, Chengqi Dong1,2
1The Fourth Clinical School of Medicine, Zhejiang Chinese Medical University,Hangzhou First People's Hospital, Hangzhou, China.
BMC neurology
|July 2, 2025
概括
像ChatGPT和DeepSeek这样的人工智能模型显示,对于PDPH信息的临床有效性. 然而,它们的完整性各不相同,在临床应用之前需要医疗保健专业人员的仔细监督.
科学领域:
- 人工智能在医学中的应用
- 临床决策支持系统 临床决策支持系统
- 医疗信息检索 医疗信息检索
背景情况:
- 持续性刺穿后头痛 (PDPH) 是持续性刺穿后的常见并发症.
- 现有的基于证据的PDPH预防,诊断和管理指南是有限的.
- 医疗保健专业人员越来越多地使用人工智能工具,需要对其临床信息质量进行评估.
研究的目的:
- 评估人工智能生成的关于PDPH管理的信息的准确性和完整性.
- 将ChatGPT-4o,ChatGPT-4o mini,DeepSeek-V3和DeepSeek-R1的响应与2023年共识指南进行比较.
主要方法:
- 对人工智能模型对PDPH共识指南的响应进行四个维度的评估:准确性,过度结论性,补充信息和不完整性.
- 使用5点利克特级别来评估答案的准确性和完整性.
- 比较了ChatGPT-4o,ChatGPT-4o mini,DeepSeek-V3和DeepSeek-R1.1的响应情况.
主要成果:
- 这四种人工智能模型都在PDPH的准则遵守方面表现出100%的准确性.
- 没有模型提供过于确或不合理的建议.
- 响应的完整性各不相同,与ChatGPT-4o和DeepSeek-R1相比,与ChatGPT-4o mini和DeepSeek-V3 (60%) 相比,ChatGPT-4o mini和DeepSeek-R1显示了更高的准则对齐 (70-80%).
结论:
- 聊天GPT-4o和DeepSeek-R1显示出强大的临床有效性和PDPH信息的指导方针对齐.
- 尽管AI模型具有很高的准确性,但它们只提供了部分指导范围 (60-80%的完整性),要求人类进行批判性评估.
- 进一步的研究对于在PDPH等复杂条件下建立可靠的AI支持临床决策至关重要.


