探索大型语言模型评估慢性疼痛经验的能力:算法开发和验证
Jacopo Amidei1, Rubén Nieto2, Andreas Kaltenbrunner1
1AI and Data for Society Research Group, Internet Interdisciplinary Institute, Universitat Oberta de Catalunya, Barcelona, Spain.
Journal of medical Internet research
|March 31, 2025
概括
大型语言模型 (LLM) 在评估慢性疼痛叙述方面表现有前途,与专家评估相似. 这项技术可以简化疼痛评估并改善患者护理.
科学领域:
- 医疗保健中的人工智能
- 对于临床应用的自然语言处理.
- 疼痛医学与管理 疼痛医学与管理
背景情况:
- 慢性疼痛影响了全球20%以上的人口,造成了重大的个人和经济负担.
- 通过书面叙述 (WNs) 进行个性化疼痛评估,可以提供超越标准化问卷的见解.
- 对临床医生来说,评估WNs是耗时的,这凸显了对高效的评估工具的需求.
研究的目的:
- 评估大型语言模型 (LLM) 在协助临床医生从书面叙述中进行疼痛评估方面的潜力.
- 这是第一个在书面叙述中探索LLM应用程序来评估患者报告的疼痛的研究.
主要方法:
- 促使GPT-4从43个纤维肌痛患者叙述中得分和解释疼痛严重程度和残疾.
- 使用相关性和协议指标,GPT-4分数与专家分数进行了定量比较.
- 专家对GPT-4的评分解释进行了定性分析,以确定其准确性和临床适用性.
主要成果:
- 对于专家来说,GPT-4的表现与专家相比,一致性高 (加权百分比>0.95) 和与标准化措施的中等相关性.
- 观察到较低的错误率 (严重程度和残疾RMSE),这表明得分可靠.
- 专家们发现GPT-4的评分和解释是充分的,尽管注意到有轻微的高估疼痛的倾向.
结论:
- LLM显示出有很大的潜力,以促进纤维肌痛患者书面疼痛叙述的评估.
- 基于LLM的自动评估提供了一种新的方法,可以增强对患者疼痛经历的理解和评估.
- 整合LLM可以简化疼痛评估,从而改善患者护理和针对慢性疼痛的量身定制干预措施.


