推理语言模型可以更透明地预测自杀风险
Thomas H McCoy1,2, Roy H Perlis3,2
1Center for Quantitative Health, Massachusetts General Hospital, Boston, Massachusetts, USA.
BMJ mental health
|May 11, 2025
概括
较小的AI模型可以使用医院数据估计自杀风险,准确度仅略有下降. 这种方法为患者护理提供了更安全,更可扩展和更透明的风险预测.
科学领域:
- 医疗保健中的人工智能
- 临床风险预测预测
- 自然语言处理自然语言处理.
背景情况:
- 之前的研究表明,大型语言模型 (LLM) 可以从医院出院说明中估计自杀风险.
- 新兴的推理模型提供了在消费级硬件上部署的潜力.
研究的目的:
- 调查较小,可访问的推理模型是否可以近似较大,更昂贵的模型在自杀风险估计中的性能.
- 分析与准确和不准确的风险预测相关的推理过程.
主要方法:
- 利用了一组由自杀或意外死亡的1,995人组成的队列,与来自超过458,000次住院的9,975名对照进行了匹配.
- 在风险预测中使用了Llama-DeepSeek-R1 8B推理模型.
- 检查了与预测准确性相关的思维链推理主题.
主要成果:
- 拉玛3蒸模型显示,估计的危险与观察到的风险之间存在显著的关联 (HR 4.65).
- 模型歧视 (c-统计) 为0.64,略低于GPT4o模型 (0.67).
- 正确的预测与药物滥用和外科手术等主题有关;错误的预测与跌倒相关的伤害有关.
结论:
- 使用本地,消费级硬件推理模型只适度影响自杀风险分层性能.
- 较小的AI模型为安全,可扩展和透明的临床风险预测提供了可行的途径.


